跳到正文
原文
Hugging Face Blog·· 2026-08-25精选AI 评分60

Multiverse Computing 提出 Quantization-Aware Healing,4-bit 压缩模型在 9 项基准中 7 项超过其全精度版本

Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original

AI 导读

Multiverse Computing 发布论文提出 Quantization-Aware Healing(QAH),直接从未压缩的原始模型蒸馏到已结构压缩并量化的学生模型,而非从恢复后的 bfloat16 检查点蒸馏。

推荐理由

原文给出压缩加量化后反超全精度版本的基准对比,以及 QAH 与 QAT 的训练稳定性差异,可供做模型压缩部署的团队参考。

来源:Hugging Face Blog · huggingface.co