星光澄海 | BLOG

改指令再行动:VLAs的语言敏感性问题怎么破

你敢信?同一个视觉-语言-动作模型(VLAs),只差一个词,让“开炉灶”的成功率从100%直接掉到2%?这就是当下具身智能核心模型的现状——对指令措辞的敏感度,比想象中夸张得多。

VLAs的“词敏感”,差一个字天差地别

这个结论来自arXiv上一篇cs.RO方向的研究,用π0.5模型做实验时,同样是“打开炉灶”的指令,说“switch on the stove”成功率100%,改成“switch on the hot plate”直接跌到2%。哪怕是经过重表述微调的π0模型,指令措辞带来的成功率波动也能达到61分。更关键的统计发现:光是指令措辞的不同,就能让模型在分布内和分布外任务的成功率差距缩小21分——说白了,很多时候模型不是没能力,是指令没说对,导致它“听不懂”。

不用重训,靠改写指令解决核心问题

研究的巧劲在于,完全不用改动模型的核心策略,不用重新训练,也不用每一步操作都验证。他们先给几个训练任务的大量指令打分,再用大模型提炼出10到20条标准化重写规则——就是把各种模糊、容易让模型误解的指令,按规则改成更清晰的版本。部署时,只要把用户的指令按规则改写一遍,再喂给模型就行。
效果够实在:在12个预留测试任务(包括对抗性指令、VLM生成指令、人类日常指令)上,模型相对表现提升了16%到27%,且好处集中在难度更高的分布外任务;对π0.5和LIBERO模型,微调后的成功率从93.6%涨到97.8%,稳定性明显变好。最方便的是,这招零样本就能用在没见过的新任务和新指令上,不用额外适配。

给具身智能行业的实际参考

之前不少人默认,VLAs作为VLMs(视觉-语言模型)的衍生模型,该继承其语言鲁棒性,但这个研究直接打破了这个假设——至少现在的VLAs还没做到。这方法最大的优势是落地成本低:不用砸钱重训大模型,只要加一层轻量的指令改写规则,就能解决核心的措辞敏感问题。
对做家庭服务机器人、具身智能应用的团队来说,这意味着不用每次换场景(从厨房整理到客厅打扫)就大动模型,改几条规则就行,拓展场景的速度能快不少,也更灵活。

这个研究没搞玄乎的新框架,抓的是VLAs最实际的小痛点——指令说不对,前面的努力可能全白费。解决方法也够接地气,不用动核心模型,见效快。只是有个问题:未来的VLAs,会不会把这种指令改写的逻辑直接内置到模型里,而不是要在外面加一层额外的规则?


素材来源:arXiv (LLM/多模态新论文) · AI情报、AI应用落地、科研前沿
查看报道原文

发表第一条评论吧

支持 Markdown