跳到正文
原文
Qwen Blog·AI 评分35

千问提出 global-batch 负载均衡,让 MoE LLM 训练更省更专

Global-batch load balance almost free lunch to improve your MoE LLM training

AI 导读

千问团队指出,现有 MoE 训练框架(如 Megatron-core)在 micro-batch 级别计算负载均衡损失,当单个 micro-batch 数据同质时会阻碍专家专业化。

来源:Qwen Blog · qwenlm.github.io