Exa Semantic Discovery·AI 评分36
NVIDIA Nemotron 30B MoE 本地部署实战:3B 激活算力与量化显存优化
NVIDIA Nemotron 30B MoE模型本地部署实战:仅需3B算力与量化显存优化-拓冰建站
AI 导读
NVIDIA 开源 Nemotron 系列 30B 总参数 MoE 模型,每次推理仅激活约 3B 参数,单 token 计算量接近 3B 稠密模型。FP16 权重约 60GB,INT4 量化后约 16~20GB,可在 24GB 显存消费级显卡上部署,16GB 需收缩上下文与并发。支持 Ollama、vLLM 等启动方式,vLLM 提供 OpenAI 兼容 API。
来源:Exa Semantic Discovery · pnsm.cn