Qwen Blog·AI 评分40
千问发布 Qwen2.5-Math-PRM 过程奖励模型与 ProcessBench 基准
Towards Effective Process Supervision in Mathematical Reasoning
AI 导读
千问开源 Qwen2.5-Math-PRM-7B 和 Qwen2.5-Math-PRM-72B 两款过程奖励模型,分别基于 Qwen2.5-Math-7B-Instruct 和 Qwen2.5-Math-72B-Instruct 微调。
来源:Qwen Blog · qwenlm.github.io