星光澄海 | BLOG

给人形机器人的“听话”能力定了统一评价标准

目前市面上已有9款行为基础模型(BFM),这是arXiv计算机科学(cs.RO)分类下的一篇论文刚理清的事——但此前没人能拿出统一标尺,评判谁的“听话”能力更强:也就是按用户意图生成精准动作的本事。

什么是BFM的“听话”能力?

BFM是把人的意图转成可执行人形机器人动作的新路子,但核心问题一直没解决:你说的话,机器人能不能真做到,而非随便晃一下手。论文里把这种能力叫“行为可操控性”,定义就是BFM能生成完全符合用户指定意图的动作。它还把这个能力拆成了三级难度:第一级是“条件操控”,比如“拿杯子”;第二级是“约束操控”,比如“拿那个蓝色的杯子”;第三级是“组合操控”,比如“左手拿蓝色杯子,走到门口递给穿灰衣服的人”——得同时满足多个要求,是最考验本事的。

RoboSteer:第一个统一评价基准

之前测BFM全是各搞各的,没统一框架,这篇论文出了个叫RoboSteer的东西,是专门测BFM行为可操控性的首个基准。它用了大规模多模态运动语料库,搭建了刚才说的三级分层体系,不管哪家的BFM,都能按同一个标准打分,不用各说各的“我们家模型更灵”。

对行业来说,这到底意味着什么?

这是第一次用RoboSteer对9款现存BFM做大规模实证研究,不是随便测几个样本,是系统对比所有主流模型的水平。而且它的意义不止于测运动控制:它是在看具身系统怎么把人的意图转成有目的的动作——这刚好是通用具身智能的核心部分。之前大家总在说“具身智能快来了”,但“听话”这件事是绕不过的坎:你让机器人拿东西,它总拿错,再强的算力也没用。有了这个统一测法,不管是做机器人的团队,还是研究机构,都能更客观地知道自己的模型在哪,别人的模型在哪,不用再凭感觉吹“技术领先”。

这事其实是给BFM的落地踩了个实点。现在有9款模型在这个基准里,未来会不会有哪款能把三级操控的得分拉到接近人类自然指令的水平?毕竟,机器人要是真能“听懂人话”,才算是从实验室里的展品,变成为普通人能用的工具的第一步。


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、具身智能、科研前沿
查看报道原文

发表第一条评论吧

支持 Markdown