Hugging Face Blog·· 2026-08-25精选AI 评分62
Multiverse Computing 提出 Quantization-Aware Healing,4-bit 压缩模型反超其全精度版本
Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original
AI 导读
Multiverse Computing 提出 Quantization-Aware Healing(QAH),把 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接在原始预压缩模型上做 KL 蒸馏而非从恢复出的 checkpoint 蒸馏,结果在 9 项基准中的 7 项超过该 60B 模型的 bfloat16 版本。
推荐理由
论文给出压缩加量化后再蒸馏原始模型的做法,读者可比较其与常规 QAT 在精度和训练稳定性上的差异。
来源:Hugging Face Blog · huggingface.co