跳到正文
原文
MiniMax 官方 Blog·精选AI 评分62

MiniMax 发布 MaxProof:用生成式验证器 RL 与进化搜索扩展数学证明

MaxProof: Scaling Mathematical Proof with Generative-Verifier RL and Evolutionary Search

AI 导读

MiniMax 发布 MaxProof 框架,结合生成式验证器强化学习与进化搜索,使 M3 模型在 IMO 2025 和 USAMO 2026 上超过人类金牌阈值。

推荐理由

原文披露了生成式验证器做 RL 奖励时的奖励黑客细节与分层防御设计,对做数学推理训练的人有可迁移的工程经验。

来源:MiniMax 官方 Blog · minimax.io