星光澄海 | BLOG

RoboQuest基准:通用物理机器人的探索困境

在RoboQuest基准测试里,目前最好的多模态物理代理,任务成功率才23%。

RoboQuest要解决的真问题

多模态基础模型发展到现在,已经能完成不少操作任务,成了所谓“通用物理代理”。但有个实打实的问题:碰到陌生环境时,要是观测里没任务需要的关键信息——比如不知道目标在哪、要查的物体属性没看到、新工具怎么用还不清楚——代理就卡壳了。总不能等着别人把信息喂到眼前,得主动通过物理交互去探索。RoboQuest就是针对这个场景做的测试基准:要求代理主动获取任务相关信息,用拿到的证据调整后续动作,还得自主判断什么时候能完成任务。它包含10个移动操作任务,围绕三类不确定性:寻找目标(搜索)、通过操作检查物体属性(比如拧开盖子看内部)、测试陌生工具的效果。

测试结果的扎眼之处

研究人员拿5个前沿多模态代理做测试,还用自己发布的全回合演示,微调了一个叫π₀.5的策略。结果很实在:最佳代理成功率23%,微调的策略几乎没成功。那是代理的操作技能不行吗?单独测每个任务需要的执行动作,把所有不确定性都去掉(给全信息),代理大多能完成动作。那失败在哪?失败分析拆出了几个具体原因:一是太早停手——代理在没拿到完成任务所需的全部证据前,就贸然决定要结束任务;二是很少处理自己探索带来的干扰——比如移动或操作时碰倒了东西,也不修复或避开;三是试错学习还是难,靠反复尝试调整策略这条路,对大部分模型来说还走不通。

对通用物理代理的提醒

对做这类产品的团队来说,这结果不是打击,是点名了核心短板:之前很多模型在“指令明确、信息全给”的场景里表现不错,但一到要主动探索、应对未知的真实环境,就露了怯。RoboQuest不是个虚的测试,它把之前模糊的“环境适应差”,变成了可量化的具体问题——80%以上的失败不是因为操作做不好,是探索和决策的问题。

我觉得这个基准的意义,是把通用物理代理的痛点摆到了台面上。最后留个问题:要让通用物理代理在陌生环境里真的能用,是得先搞定“什么时候该继续探索、什么时候该停”的决策,还是得先让它们能处理自己制造的连锁干扰?


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、AI智能体、具身智能
查看报道原文

发表第一条评论吧

支持 Markdown