跳到正文
Exa Semantic Discovery·· 1 天前AI 评分28

Nemotron 在 GB10 上的 FP8 专家加载修复:TensorRT-LLM PR #19806 让吞吐提升 64%

Nemotron on GB10: FP8 experts that would not load, now 64% faster than BF16 · TurinTech

AI 导读

TensorRT-LLM PR #19806 让采用非门控专家的 FP8 block-scale MoE 检查点可在 GB10(SM121)上加载,在 Nemotron 3.5 Lightning 30B-A3B 上输出吞吐较 BF16 提升 64.3%,模型权重缩小 44.9%,MMLU 五-shot 分数基本不变。该 PR 于 10 月 8 日获 reviewer 批准,目前等待合并。

来源:Exa Semantic Discovery · turintech.ai