跳到正文
原文
Qwen Blog·AI 评分40

千问发布 Qwen2.5-Math-PRM 过程奖励模型与 ProcessBench 基准

Towards Effective Process Supervision in Mathematical Reasoning

AI 导读

千问开源 Qwen2.5-Math-PRM-7B 和 Qwen2.5-Math-PRM-72B 两款过程奖励模型,分别基于 Qwen2.5-Math-7B-Instruct 和 Qwen2.5-Math-72B-Instruct 微调。

来源:Qwen Blog · qwenlm.github.io