M5 Max MacBook Pro 上运行 LFM2.5-VL-3B 视觉语言模型,加上一个2.8亿参数的DSpark draft模型,解码速度能飙到原来的3.13倍,输出结果和原模型完全一致。这是Liquid AI最近放出的实验性更新,核心是把文本领域的DSpark draft技术用到了视觉语言模型上。
DSpark:跨模态通用的draft方案
什么是speculative decoding?简单说,原模型一次只生成一个token,draft模型会提前猜几个token,原模型一次检查整批候选,符合的就留用,这样能减少重复计算、提升速度。DSpark原本是Liquid AI给文本模型做的draft方案,这次用到VL模型上,核心设计是模态不敏感——不管是文本token还是图像patch,到了模型隐藏层都只是张量,所以不用改算法,直接复用了文本模型的推理逻辑。
具体架构上,DSpark是简化的注意力模型,4层结构,推理时块大小选8(苹果芯片用)或9(数据中心GPU用)。总参数279.5M,只比原模型增加了8.9%,增量不算大。训练环节用的是AMD硬件,用覆盖主流VL任务的监督微调数据跑了10个epoch,所有模型 ablation 都是在AMD上完成的。
实测速度:数据中心与边缘的差异
这次测试用的是MMSpec基准,覆盖6种VL任务,运行条件统一为batch size1、温度0、模型用16位权重。解码速度表现亮眼:M5 Max上能到2.3x到3.13x,M3 Ultra苹果芯片是1.57x到2.14x,单张H100 80GB的SGLang环境下是2.04x到2.66x。但端到端速度要低不少:M5 Max上是1.56x到2.62x,H100是1.64x到2.27x。
原因很明确:speculative解码只加速生成阶段,图像编码和prefill(前置处理)的速度没变。边缘设备算力弱,prefill和编码占总延迟的比例更高,按Amdahl定律,加速比受限于未加速的部分。比如TextVQA任务在M5 Max上,解码快了2.69倍,但端到端只快1.56倍。另外,并发升高时,单H100的DSpark吞吐量优势会缩小;温度越高,候选token的概率越分散,draft和原模型的分歧越多,接受率越低,速度也会变慢。
落地的现状与局限
DSpark的权重已经放在Hugging Face,支持Safetensors和GGUF格式,当前SGLang v0.5.19以上、MLX-VLM v0.7.2以上、llama.cpp都提供了支持。不过这是实验性更新,授权用的是LFM Open License v1.0,只有年营收低于1000万美元的公司可以免费商用。
目前DSpark的加速不覆盖量化模型,后续会不会支持还没明确。
从这次的更新看,把文本领域的draft技术适配到VL模型,解决了跨模态的核心问题,速度提升是实打实的。不过边缘端的端到端提升有限,量化支持的缺失也限制了在消费级设备上的应用。如果未来DSpark能适配量化模型,会不会是推动移动端VL应用落地的重要一步?
素材来源:MarkTechPost · AI情报、AI芯片与算力、开源生态、科研前沿
查看报道原文

发表第一条评论吧