Qwen Blog·AI 评分35
千问提出 global-batch 负载均衡,让 MoE LLM 训练更省更专
Global-batch load balance almost free lunch to improve your MoE LLM training
AI 导读
千问团队指出,现有 MoE 训练框架(如 Megatron-core)在 micro-batch 级别计算负载均衡损失,当单个 micro-batch 数据同质时会阻碍专家专业化。
来源:Qwen Blog · qwenlm.github.io