Qwen Blog·· 2025-07-27精选AI 评分60
Qwen 团队提出 GSPO:面向语言模型的可扩展强化学习算法
GSPO: Towards Scalable Reinforcement Learning for Language Models
AI 导读
Qwen 团队提出 Group Sequence Policy Optimization(GSPO)算法,基于序列似然定义重要性比率并做序列级裁剪、奖励和优化。
推荐理由
原文给出 GSPO 与 GRPO 在训练稳定性、效率和 MoE 场景下的对比,读者可据此理解 RL 扩展的算法取舍。
来源:Qwen Blog · qwenlm.github.io