导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜
快讯 机构 观点 人物 专题

逆天压缩术:120B模型瘦身一半反变聪明,量化蒸馏新路径挑战AI铁律

长期困扰AI领域的“压缩必然掉精度”铁律,正被一项新研究打破。Multiverse Computing团队公布最新成果:一款经过深度压缩的大语言模型,不仅未损失能力,反而在多数基准测试中击败了同规模的全精度模型,引发业内广泛关注。

这款名为Hypernova-60B的模型,从GPT-OSS 120B蒸馏而来,并将每个参数量化至仅4比特。与传统认知相悖,它在9项对比基准中的7项上,超越了同参数量但以全精度训练的60B模型。尽管原始120B模型在大多数对决中依然胜出,但两者间的差距已急剧缩小。

Myriad: When will OpenAI release GPT-6? Click to make your prediction.

AI模型的参数如同密密麻麻的旋钮,存储着模型学到的知识。更多参数通常意味着更强智能,但同时也带来高昂的计算与内存开销。业界普遍通过剪枝和降低数值精度来压缩模型,类似压缩照片,但代价始终是质量下降。这项研究提供了更优路径。

论文指出,关键在于规避所谓的“复印错误”。传统蒸馏中,小模型模仿的是已“半缩水”的教师模型,后者本身就是原始模型的模糊拷贝,学生难以超越不完美的教师。Multiverse团队采用“量化感知修复”策略,让小模型直接以原始未量化的120B大模型为监督信号,从而取得意外效果。

Defying the AI Trade-off: Researchers Shrink a 120B Model and Make It Smarter

压缩后的模型内存占用约为原来的四分之一,参数量减半,意味着它可以在普通台式机甚至手机上运行,极大降低了部署门槛。团队已公开Hypernova-60B的权重于Hugging Face,供开发者自由下载测试。

这一成果也契合了近期开源模型持续超预期的大趋势,例如神秘的Ox Alpha系统击败Claude、阿里Qwen 3.8 Flash Next引发的热议,以及利用更大LLM推理轨迹进行微调的手法。但研究同样存在局限:生成60B学生模型的压缩工具是专有的,完整配方未公开,且实验仅在GPT-OSS上进行,尚未验证于Llama、Qwen或Mistral等主流系列,泛化性存疑。

Defying the AI Trade-off: Researchers Shrink a 120B Model and Make It Smarter

对于AI工程实践者而言,这项研究的启示清晰:在基于蒸馏的修复流程中,量化不仅是需要最小化的成本,更是教师监督的额外机会。最终产物是一个部署更便宜、内存更轻,且精度不逊于全精度对应品的模型。业界的压缩思维,或许正错过一片新大陆。