MiniMax 官方 Blog·精选AI 评分66
MiniMax 发布 Forge 可扩展 Agent RL 框架与算法
Forge: Scalable Agent RL Framework and Algorithm
AI 导读
MiniMax 发布内部强化学习框架 Forge,用于在真实智能体场景中大规模训练,并支撑 MiniMax M2.5 的能力突破。Forge 在 M2.5 训练中接入超过十万个不同的真实智能体脚手架与环境,上下文长度达 200k,日吞吐量达数百万样本,奖励保持收敛。
推荐理由
原文披露了 Forge 在十万级智能体脚手架上的训练规模与 40 倍训练加速,可据此了解长程 Agent RL 的工程取舍。
来源:MiniMax 官方 Blog · minimax.io