跳到正文
原文
MiniMax 官方 Blog·精选AI 评分62

MiniMax 调查 LLM 无法输出「马嘉祺」:稀疏 token 遗忘机制与修复实验

Why Can't the MiniMax LLM Say "Ma Jiaqi"? Internal Investigation of Sparse Token Forgetting

AI 导读

MiniMax 针对 M2 系列模型无法输出「马嘉祺」等低频 token 的现象发布内部调查,确认问题出在后训练阶段而非 tokenizer 对齐。分析显示,后训练数据中「嘉祺」样本不足 5 条,导致 lm_head 中该 token 向量发生显著漂移,而输入侧 vocab embedding 几乎不变,因此模型只丧失生成能力而保留理解能力。

推荐理由

MiniMax 公开了稀疏 token 遗忘的内部调查,从 tokenizer 到 lm_head 逐层定位原因,并给出可复用的修复实验方案。

来源:MiniMax 官方 Blog · minimax.io