跳到正文
原文
Kimi 官方 Blog·精选AI 评分62

Muon 可扩展用于 LLM 训练:月之暗面开源 Moonlight 3B/16B MoE 模型

Muon is Scalable for LLM Training

AI 导读

月之暗面提出让 Muon 优化器可扩展到大模型训练的两项关键技巧,即加入权重衰减和按参数调整更新尺度,使其无需调参即可用于大规模训练。缩放律实验显示,在算力最优训练下 Muon 相比 AdamW 达到约 2 倍计算效率,仅需约 52% 的训练 FLOPs 即可达到相当性能。

推荐理由

原文给出 Muon 扩展到大规模训练的两项关键技巧与缩放律对比,并开源了分布式实现和 Moonlight 模型权重。

来源:Kimi 官方 Blog · github.com