跳到正文
原文
Qwen Blog·· 2025-07-27精选AI 评分60

Qwen 团队提出 GSPO:面向语言模型的可扩展强化学习算法

GSPO: Towards Scalable Reinforcement Learning for Language Models

AI 导读

Qwen 团队提出 Group Sequence Policy Optimization(GSPO)算法,基于序列似然定义重要性比率并做序列级裁剪、奖励和优化。

推荐理由

原文给出 GSPO 与 GRPO 在训练稳定性、效率和 MoE 场景下的对比,读者可据此理解 RL 扩展的算法取舍。

来源:Qwen Blog · qwenlm.github.io