Hugging Face Blog·AI 评分39
Hugging Face 提出离线 Top-K Logits 与融合分块 KL 损失,大幅降低 LLM 知识蒸馏成本
Making Knowledge Distillation Cheap Enough to Run at Scale
AI 导读
Hugging Face 论文提出两项系统改动降低 LLM 知识蒸馏成本:离线缓存教师模型每位置的 top-100 logits,使教师无需与学生同时驻留显存;融合分块 KL 损失将输出投影直接并入损失计算,避免生成完整的词表×序列长度矩阵。以 gpt-oss-120b 为例,稠密 KL 峰值约 250GB 显存,融合分块版本峰值约 128GB,使长上下文修复可在单 GPU 上完成。
来源:Hugging Face Blog · huggingface.co