星光澄海 | BLOG

微软出新决策模型Decision-1:基于Qwen3.5-9B,快且准

微软刚上线的Decision-1,在自家36个基准测试里平均准确率83.5%,p50延迟仅85毫秒,比竞品Quyet-1.0-Large快了4.5倍。这不是那种写文章的生成模型,是专门干决策评分的——给固定选项打分,返回概率值,不用写句子。

Decision-1到底是什么?

微软说这是新的AI分类,定位是给软件做直接执行的决策场景。简单说,它的任务就是:给你输入的问题、选项,算出每个选项的概率,输出JSON格式的结果,不用生成任何文本内容。它是基于阿里的Qwen3.5-9B微调的,现在在微软Foundry和OpenRouter上线,只有托管API,没有开源权重,也没推出量化版本。支持的场景包括yes/no题、多选、评级、分类、AI响应评分、证据比对,还能设置“无法回答”的选项。

核心表现:快、准、还便宜

它的上下文窗口是32768 token,微软测了9个系统、36个基准、14.7万道题,Decision-1的平均准确率83.5%,比第二名Quyet-1.0-Large的81.9%高一点;校准分92.2,比Quyet的93.1稍逊。延迟更亮眼:p50是85ms,p95是125ms,比GPT-6 Sol的3秒快了35倍。价格也友好:每百万输入token0.042美元,输出免费,而OpenAI的Luna决策端点要0.1美元/百万输入,贵一倍多。内部测试的案例也够实在:Xbox排序1万+反馈,速度比GPT-6 Sol快14倍,成本低200倍;Copilot质控比GPT5.6 Luna快100倍。另外扰动测试里,改请求说法、打乱选项,只有1.3%的决策翻转,稳定性还行。

能用在哪,有啥限制?

适合的场景都是需要快速决策的地方,比如业务分类、内容评级、AI响应校验这些。但有几个硬限制:只能处理文本,不支持图像音频;输出没有解释,你不知道为什么它选这个;不能单独用在信用、雇佣、住房、医疗、法律这类敏感决策,必须设置人工监督;还有个小遗憾:只有API,没法本地部署,想自己改的人没戏。另外竞品H2O还指出,微软的延迟测试可能不准,他们自己测的模型延迟是29ms,但微软的Decision-1没上第三方JevBench的榜,那边H2O的模型排第一。

总的来说,Decision-1是个专门场景的好用工具,速度和成本比通用模型有优势。现在的问题是:这种只做决策评分的小模型,会不会抢了通用大模型里决策模块的生意?毕竟通用模型也能做这些,但速度和成本比不了它。


素材来源:MarkTechPost · AI情报、大模型、开源生态、AI基础设施
查看报道原文

发表第一条评论吧

支持 Markdown