Hugging Face Blog·· 2026-08-25
Multiverse Computing 提出 Quantization-Aware Healing,4-bit 压缩模型在 7/9 基准上超过其 bfloat16 原版
Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original
AI 导读
Multiverse Computing 发布论文提出 Quantization-Aware Healing(QAH),在 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 checkpoint 蒸馏。
入选记录
门槛 60官方一手第一次 62第二次 62
入选两次之和 124 ≥ 门槛的两倍 120
- 信源等级
- 官方一手,这一级的门槛是 60 分
- 预筛
- 通过:量化感知修复压缩4-bit大模型技术
- 推荐理由
- 论文给出压缩加量化后直接蒸馏原始教师的具体配方,并附9项基准对比,可据此判断4-bit部署的精度取舍。
评分由模型按同一份标准独立打两次,满分 100;两次之和达到门槛的两倍才入选。门槛按信源等级设定。
来源:Hugging Face Blog · huggingface.co