星光澄海 | BLOG

7.89GB 2-bit模型:比原版Qwen工具调用还强

谁能想到,把54GB的Qwen3.8-27B压到7.89GB,工具调用性能反而超过了原版?Underdog团队推出的Saluki 27B,就是这么个打破直觉的压缩模型。

压得小,还没丢关键技能

来自Conway Research的Underdog,这次把Qwen3.8-27B做成了2-bit的GGUF版本,文件大小仅7.89GB——原版BF16格式要54GB,差了快7倍。更狠的是它的工具调用能力:在120项任务的Underdog Bench里,Saluki拿了88分,原版只有84;并行工具调用测试中,Saluki更是拿到42分,原版35,整整高了20%。它还能直接跑在标准的llama.cpp上,不需要改代码或用专属fork,这对开发者太省事了——不用折腾适配,就能用27B级别的工具调用模型,而且还是Apache2.0授权,个人和商业项目都能用。

定制压缩,盯着工具调用下功夫

为什么压缩后工具调用反而变强?Underdog没搞通用压缩,是专门盯着工具调用调的。它经过两层压缩:先有ISTA-DASLab的GSQ-RCO版本,8.4GB、2.5bit,再经Underdog自己的优化缩到7.89GB,还保留了imatrix标签,只是完整压缩配方没公开。它的平均性能保留率在9个基准题里达96%,但也有取舍:数学推理掉分最狠,AIME2025只有79.2,原版是96.7,少了17分,相当于性能保留率仅82%。说白了,它把力气全花在了最核心的工具调用上,其他能力放了点水。

开发者的选择题,行业的新方向

对开发者来说,Saluki是个划算选项——不用占54GB空间,就能用足够强的工具调用能力,还适配现有工具。但也得做权衡:同类型的Bonsai 2更小,只有5.95GB,数学推理更强,AIME2025能到95,但它得用PrismML改的llama.cpp fork,不能跑标准版本,开发者得根据自己的场景选。这事儿给行业提了醒:大模型压缩不是“越小越好”,针对具体任务的定制化优化,比通用压缩有用得多。

说白了,现在落地要的不是“全功能大模型”,是“刚好适配需求的模型”——不用占满50多GB的硬盘,在你需要工具调用的场景里够顶。当模型压缩到7.89GB这个量级,我们是不是该彻底放弃“做一个全能27B模型”的执念,转而给每个场景定制最合适的小模型?


素材来源:MarkTechPost · AI情报、大模型、开源生态
查看报道原文

发表第一条评论吧

支持 Markdown