跳到正文
热点事件观察中

TurinTech 提交 TensorRT-LLM PR 支持 GB10 FP8 MoE

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

TurinTech 提交的 TensorRT-LLM PR #19806 让采用非门控专家的 FP8 block-scale MoE 检查点可在 GB10(SM121)上加载。据该 PR 描述,在 Nemotron 3.5 Lightning 30B-A3B 上输出吞吐较 BF16 提升 64.3%,模型权重缩小 44.9%,MMLU 五-shot 分数基本不变。 该 PR 于 2026 年 10 月 8 日获 TensorRT-LLM reviewer 批准,目前等待合并。其 padding 仅限 MoE tensor parallelism 为 1 的情况,跨多 GPU 的非对齐尺寸仍会报错;SM90 和 SM100 路径因缺少硬件未做测试。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. Exa Semantic Discovery
    Nemotron 在 GB10 上的 FP8 专家加载修复:TensorRT-LLM PR #19806 让吞吐提升 64%

    TensorRT-LLM PR #19806 让采用非门控专家的 FP8 block-scale MoE 检查点可在 GB10(SM121)上加载,在 Nemotron 3.5 Lightning 30B-A3B 上输出吞吐较 BF16 提升 64.3%,模型权重缩小 44.9%,MMLU 五-shot 分数基本不变。该 PR 于 10 月 8 日获 reviewer 批准,目前等待合并。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。