Qwen Blog·· 2025-03-06精选AI 评分80
Qwen 发布 QwQ-32B 推理模型,320 亿参数对标 DeepSeek-R1
QwQ-32B: Embracing the Power of Reinforcement Learning
AI 导读
Qwen 发布 QwQ-32B,一个 320 亿参数的推理模型,官方称其性能可与 6710 亿参数(激活 370 亿)的 DeepSeek-R1 相比。该模型以 Apache 2.0 协议在 Hugging Face 和 ModelScope 开源权重,并可通过 Qwen Chat 使用。
推荐理由
原文给出 32B 模型对标 671B 的评测结果与两阶段 RL 训练方法,可据此判断小模型推理路线的可行性。
来源:Qwen Blog · qwenlm.github.io