研究团队打造出更小、更便宜的大模型版本,结果却更聪明
一支研究团队刚刚构建了一个大型AI模型的缩小版,不仅体积更小、成本更低,而且表现竟然比原版还要出色。这种现象本不该发生——就像减掉肌肉的同时却变得更强壮。但Multiverse Computing的研究团队声称他们做到了,而背后的原因则揭示了我们在模型压缩方面一直以来的误区。
研究人员在周五发表的一篇论文中写道:“对于从业者而言,实际启示是:在基于蒸馏的修复流程中,量化步骤并非需要最小化的成本,而是教师监督的额外机会。它能够产出一个服务成本更低、内存占用更少、且准确度至少与全精度版本相当的模型。”
可以将AI模型的参数想象成一面巨大的旋钮墙——这些数字承载了模型学到的一切。旋钮越多,模型越智能,但运行起来也越沉重。OpenAI的GPT-OSS 120B拥有1200亿个这样的旋钮,每一个都需要消耗内存和电力。为了廉价地部署AI,公司们会削减旋钮数量并压缩存留的旋钮。这就像压缩一张照片:文件变小了,但压缩过度会导致图像模糊(比如从4K降到720p)。将模型压缩得太厉害,它就会变笨。所有人都接受了这种权衡。
但这次的研究人员走得更远。他们将GPT-OSS削减至600亿参数,并将每个参数压缩到极小的4位位宽——这在数字领域相当于极限压缩。通常这会摧毁模型,但这些研究人员找到了一种方法,反而提升了它。在几乎所有用于对比的基准测试中,这个更小的模型都优于用全精度构建的模型。
当你压缩模型时,通常的做法是将它与“半压缩”版本(即拥有600亿旋钮但精度更高的版本)进行对比,以修正其错误。问题在于,半路模型本身已经是原版的模糊复制品。因此,你是在教小模型模仿一个有缺陷的双胞胎,它永远无法超越这个双胞胎。而研究人员所说的“量化感知修复”改变了目标。它让小模型直接指向大型、未压缩的原版,并告诉它:复制这个版本的答案。小模型从大师那里学习,而不是从浑浊的中间态学习。在9项测试中的7项里,4位600亿参数的模型击败了那个本应成为其“更好一半”的600亿参数双胞胎。真正的1200亿参数模型仍然在大多数项目中胜出——大小并未被完全否定——但“瘦身版”模型跨越了人们认为不可能跨越的界限。
更小、更智能的意义重大,因为AI极度依赖硬件。修复后的模型所需内存约为原版的四分之一,旋钮数量也减半。这相当于一个只能运行在数据中心里的AI与一个能跑在普通台式机——甚至最终跑在手机上的AI之间的差距。因此,一个能够以一半能耗产出更好结果的模型,对于小型实验室和本地开发者来说意义非凡。
而且它是免费的。研究团队已在Hugging Face上以开放权重形式发布了修复后的Hypernova-60B模型,任何人都可以下载并运行。这符合当前开源模型不断突破界限的趋势:神秘免费模型Ox Alpha最近击败了某个Claude系统(其构建者未知);围绕阿里巴巴Qwen 3.8 Flash Next的炒作;以及通过从Fable或Claude Opus等更大LLM中提取推理轨迹来改进小模型的微调浪潮。
不过,不要过度乐观。用于制造60B学生的压缩工具是专有的,因此配方尚未完全开源,而且团队只测试了GPT-OSS——并未涉及Llama、Qwen或Mistral系列。

交易所
交易所排行榜
24小时成交排行榜
人气排行榜
交易所比特币余额
交易所资产透明度证明
去中心化交易所
资金费率
资金费率热力图
爆仓数据
清算最大痛点
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
ETF追踪
索拉纳ETF
瑞波币ETF
香港ETF
比特币持币公司
加密资产反转
以太坊储备
HyperLiquid钱包分析
Hyperliquid鲸鱼监控
大额转账
链上异动
比特币回报率
稳定币市值
期权分析
新闻
文章
财经日历
专题
钱包
合约计算器
账号安全
资讯收藏
自选币种
我的关注