跳到正文
热点事件持续更新

NVIDIA Nemotron 30B MoE 本地部署教程

1 篇报道1 个报道来源14 小时前更新

先了解这件事

AI 综述

2026年10月2日,Exa Semantic Discovery 发布 NVIDIA Nemotron 30B MoE 本地部署实战报道。报道称 NVIDIA 开源 Nemotron 系列 30B 总参数 MoE 模型,每次推理仅激活约 3B 参数,单 token 计算量接近 3B 稠密模型。显存方面,报道称 FP16 权重约 60GB,INT4 量化后约 16~20GB,可在 24GB 显存消费级显卡上部署,16GB 显存需收缩上下文与并发。部署方式上,报道称支持 Ollama、vLLM 等启动方式,其中 vLLM 提供 OpenAI 兼容 API。此为目前唯一报道,尚无后续进展或矛盾信息。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. Exa Semantic Discovery
    NVIDIA Nemotron 30B MoE 本地部署实战:3B 激活算力与量化显存优化

    NVIDIA 开源 Nemotron 系列 30B 总参数 MoE 模型,每次推理仅激活约 3B 参数,单 token 计算量接近 3B 稠密模型。FP16 权重约 60GB,INT4 量化后约 16~20GB,可在 24GB 显存消费级显卡上部署,16GB 需收缩上下文与并发。支持 Ollama、vLLM 等启动方式,vLLM 提供 OpenAI 兼容 API。

本事件热度走势

当前热度 7·可比范围峰值 7(10月2日 20:00)·近 24 小时可比范围变化 –

0246810月2日20:0010月2日21:0010月2日21:0010月2日22:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。