跳到正文
原文
Qwen Blog·· 2025-03-06精选AI 评分80

Qwen 发布 QwQ-32B 推理模型,320 亿参数对标 DeepSeek-R1

QwQ-32B: Embracing the Power of Reinforcement Learning

AI 导读

Qwen 发布 QwQ-32B,一个 320 亿参数的推理模型,官方称其性能可与 6710 亿参数(激活 370 亿)的 DeepSeek-R1 相比。该模型以 Apache 2.0 协议在 Hugging Face 和 ModelScope 开源权重,并可通过 Qwen Chat 使用。

推荐理由

原文给出 32B 模型对标 671B 的评测结果与两阶段 RL 训练方法,可据此判断小模型推理路线的可行性。

来源:Qwen Blog · qwenlm.github.io