巴西小AI实验室Supersonic Labs近期发布的Julia 1,最值得聊的两个数字:144.3M参数,训练总花费约104美元的云GPU费用,而且普通CPU就能流畅运行。
低成本背后的技术选择
Julia1不是从零训练的,是基于JHU CLSP的mmBERT-small改造而来——这个预训练模型本身140M参数,覆盖1800多种语言,多语言基础扎实。Supersonic Labs保留了原有的编码器和分词器,只加了一个专门处理决策的头部,在决策类数据集上微调。官方明确说,这不是Qwen的微调版本,走的是轻量复用路线。
它的权重现在放在Hugging Face上,用Apache2.0许可,能直接用Python3.11+在CPU上跑,支持BF16的GPU也能运行,还有ONNX版本可在浏览器通过WebGPU使用。托管API还没开放,以后会上线,定价大概是每百万token0.025美元。
三个场景的决策能力
Julia1和普通生成式大模型不一样,它不生成文本,只做决策类的活,一个API就能覆盖三种需求:一是choice,从2到20个候选答案里选一个,还返回每个选项的概率;二是score,返回有序评分,比如低、中、高对应的位置;三是noul,返回是非题陈述正确的概率。输入会原样保留调用方的ID,比如账单号之类的,输出概率和选项顺序对应。
它的基准测试是2026年9月24日做的,用H200的BF16算力,对比TypeSafe的Jev(用Jev基准协议的参考值,不是新跑的Jev数据)。亮点是在Typed Decisions(73.15% vs参考72.70%)、AG News分类(94% vs91%)、DAIR情绪分类(86% vs48%)这三个场景都超过或持平参考值,但Banking77的72标签分类只拿到64%,比参考的87%差很多,是明显的短板。9月25日的CPU复现跑了一遍,结果差不多,Typed Decisions72.55%,Banking77是60/100,还有3次弃权。
延迟数据也有意思:苹果M4上,每次决策的中位数延迟是33.15毫秒;三星平板用ONNX Runtime是203毫秒,峰值内存393MB;英特尔i5-1235U上,AG News分类是107.83毫秒,Banking77因为要先筛选72个标签,延迟涨到3713.54毫秒。有人在X上说它比Jev在i5笔记本上快5倍,但这个要谨慎——Jev是托管服务,调用地点是法国,延迟不能直接比。
对中小团队的实际价值
Julia1的优势很明确:参数不大、成本极低、全量开放,还能在CPU上跑,不用依赖贵的GPU,也不用付高额的API费用。对比同类型工具:TypeSafe的Jev是专有技术,不能直接拿权重;GLiNER2.5 Multi有287M参数,比它大一倍,虽然也是开放权重,但没有CPU运行的优势。
不过它也有明显局限:没法处理缺失事实、代数运算、多步计算;在标签筛选阶段可能会丢正确选项;不是通用Transformer pipeline,Hugging Face上也没有推理提供商支持它。官方建议,一定要用自己的问题测试,关键决策还要有人工审核。
现在大模型都在往万亿参数堆,这个1.44亿参数的小模型,靠低成本和CPU运行的特点,会不会让更多中小团队不用凑钱租GPU或买API,就能用上决策类的AI工具?
素材来源:MarkTechPost · AI情报、开源生态、AI基础设施、科研前沿
查看报道原文

发表第一条评论吧