星光澄海 | BLOG

RobotWorld基准测试:智能体在物理机器人上的表现差在哪?

RobotWorld给智能体测了84个机器人任务,结果打破了不少人对通用智能体的期待——那些能写代码、搞定复杂数字任务的模型,到了物理世界就容易掉链子。

RobotWorld测的不是虚的,是真的机器人活

这篇来自arxiv的cs类研究,搞了个叫RobotWorld的仿真测试平台,专门看智能体把人类指令、环境观测转化成机器人物理执行的能力。它覆盖的任务类型很全:小物件操纵、带着东西移动、走路/跑、开车、甚至无人机操控,加起来整整84个。每个任务不是凭感觉打分,有两个硬标准:一是明确的交互预算(最多能做多少次动作),二是机器能直接判定的成功条件,不用人工瞎评。

智能体的「物理跨界」,不是技能不够,是拼不起来

现在的通用智能体确实有两把刷子:能做图像分割(认出要抓的瓶子)、能校准相机(知道环境的空间坐标)、能算物理动力学(知道推东西要多大劲)。但这些单个技能,拼到一起就乱套了。比如模型能走到指定位置,但忘了任务里要盯着的那个小零件;做了个没用的动作,自己也不会调整;反应慢半拍,错过修正的时机;甚至把没完成的任务(比如还没把零件放好)当成做完了。还有个有意思的细节:不同模型的擅长点完全不一样——叫Astra的模型,在靠空间判断、有约束接触的任务上成功率高;Opus5.5呢,在要连续平衡、定时交互的任务上更顺。

这个测试,给机器人智能体指了明确的改进方向

RobotWorld不是用来吹智能体有多牛的花架子,它是个严格的试验场。研究人员把任务结果和智能体的执行过程绑在一起分析,能精准找到问题在哪——不是说模型没学会图像分割,而是它会分割,但不知道什么时候该用这个分割结果来调整动作。说白了,这就给训练和设计更靠谱的物理机器人智能体,指了具体要补的地方:不是堆更多单个技能,是补技能之间的衔接逻辑。

我觉得这篇研究最实在的地方,是没回避通用智能体的短板,反而把物理世界里的隐形坑给挖出来了。现在大家都在喊通用智能体落地,可一到机器人这,总卡在「从数字到物理的最后一步」。那问题来了:要让智能体在物理世界靠谱,是得给它们补更多物理常识,还是得把「状态跟踪」做成核心能力?


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、AI智能体、具身智能
查看报道原文

发表第一条评论吧

支持 Markdown