两家生产环境A/B测试显示,Fireworks AI刚发布的Ember-1模型,在编码任务上保持和Kimi K3几乎完全一致的质量(任务分数0.753 vs 0.751),总tokens却少了39%,推理tokens更是砍了71.3%。
它不是“偷懒版”K3,是“高效版”
很多人第一反应,这是不是把K3的“推理强度”调低了?答案是否定的。Fireworks团队试过直接降低K3的推理力度,结果任务质量掉得太厉害——而Ember是另一个思路:让模型“更聪明地想”,不是“想得更少”。它保留了K3有用的自我反思、假设校验这类推理,只是砍掉了冗余的循环和无效思考。
Ember是基于Moonshot AI开源权重模型Kimi K3做的后训练,不是新训的模型。Fireworks的核心需求很明确:客户想要K3的编码能力,但又嫌它推理太“费token”。多轮Agent场景下,每一轮都要重放之前的长推理,上下文成本会按回合数的平方涨,所以必须解决这个痛点。
省token的核心:删冗余推理,不砍有用思考
为了让模型高效思考,Fireworks做了50次训练实验、200次评估,还开发了未公开的新训练算法,训练用的是自家数据,没碰客户数据。训练覆盖数学、编码、对话、工具调用等多场景,既有单步问题也有多步交互。
从测试数据看,Ember的表现和K3 Max(最高推理强度版本)各有胜负:Terminal Bench 2.1测试里,Ember准确率82%,比K3 Max的80.9%还高1.1个百分点;DeepSWE 1.1里,Ember到75.2%,领先K3 Max的66.4%。但SWE-bench Verified和SWE-Interact里,Ember略逊于K3 Max,分别是92.2%和20%,对应K3 Max是93.2%和21.3%。
跨7个基准和2个客户生产数据,Ember的tokens节省在35%-50%区间,和宣传的“约40%”吻合。连Doximity的500个临床病例测试里,Ember都跑出了新的成本-质量最优边界。
能用,但只能通过Fireworks API
Ember目前是研究预览阶段,只能通过Fireworks的无服务器API调用,既没放出权重也没公开训练代码,没法自己部署。价格和K3完全一致:输入token每1M 3美元,缓存输入每1M 0.3美元,输出每1M 15美元。省下的钱全来自少生成的token——刚才的A/B测试里,输出成本从0.74美元降到0.45美元 per 任务。
一点判断和问题
现在推理模型的token成本,对多轮Agent、编码这类场景来说,已经是落地的核心瓶颈。Ember没牺牲质量就省了近40%的token,比单纯堆上下文窗口更实在——毕竟上下文越长,缓存成本也会跟着涨。当企业开始把推理成本算进Agent落地的ROI时,这种“不打折质量”的token压缩,会不会很快成为推理模型的标配?
素材来源:MarkTechPost · AI情报、开源生态、AI基础设施、科研前沿
查看报道原文

发表第一条评论吧