在RTX 4090上单问题仅需8毫秒的多模态模型,今天多了两个新成员,而且它们完全不生成输出Token。
什么是零输出Token的决策模型?
很多人熟的是生成式LLM:token接token吐答案,你得拆词、解析、取结果。而Liquid AI的d1系列,是另一条路:单前向传递,输出校准过的、带明确类型的答案,全程零输出Token。
它的核心是处理“状态”和“命名问题”,返回的是每个允许选项的概率:要么是是/否的概率,要么是预设选项的分布,要么是2到10级评分的加权位置。这不是用来聊天的,是专门做决策的——比如判断订单该不该退款、内容合不合规这类要明确结果的场景。
两款模型的参数和适配场景
这次发布的d1-3B和d1-omni-600M,都已经在Hugging Face开放,原生支持llama.cpp,不用复杂适配。许可证用的是LFM Open v1.0,年营收低于1000万美元就能免费商用,门槛不高。
d1-3B是3.12B参数,从LFM2.5-VL-3B融合微调来,支持文本+图像输入,适配NVIDIA DGX服务器、RTX工作站和Jetson边缘板。实测里,它在Jetson AGX Thor上处理384px图像只要35毫秒,官方的Open d1 Arcade还能用它做实时摄像头的内容审核、手势控制,落地性很强。
d1-omni-600M是587M参数,从双向编码器LFM2.5-Encoder-350M改来,支持文本+图像、文本+音频(单请求里不能同时带图像和音频),音频训练只覆盖了英语对话,适合语音命令路由这类小设备场景,延迟还没公开,但参数小的优势摆在那,轻量设备跑起来应该很稳。
性能和落地的边界
d1-3B在Decision Index v0.2.1拿了48.57分,是10B参数以下模型里最高的,比34.7B的Decider 35B-A3B(47.11)还高,仅次于Winnow-12B的50.02分。文本基准平均82.9分,比Decider 4B的81.1高;图像基准平均74.1,比自身基础模型的73.9略高,小参数的表现不算差。
延迟数据够实在:RTX 4090上单问题8毫秒,AMD MI325X要9毫秒;Jetson系列里,AGX Thor是16毫秒,Orin Nano是50毫秒。这速度对实时场景太关键了——比如工单分类,一个d1-3B调用就能同时处理“是否退款、归属团队、紧急度”三个问题,不用拆生成的token,直接拿结果用,省了很多解析成本。
当然也有短板:它的知识类基准得分只有23.8,比其他类型低;音频决策的基准还没成熟,暂时没法挑复杂的语音场景。
从参数、延迟到适配场景,这两款模型都是瞄准了NVIDIA硬件的实时决策需求。现在小参数模型也能在特定决策场景压过大参数模型,这类“零输出”的方向会不会慢慢替代一部分需要生成的轻量任务?
素材来源:MarkTechPost · AI情报、大模型、AI芯片与算力、AI应用落地
查看报道原文

发表第一条评论吧