星光澄海 | BLOG

机器人抓稳的秘密:触觉数据提了10.5个百分点成功率

用多手指机器人抓东西,加了高分辨率触觉数据后,抓稳成功率比只用视觉的提了10.5个百分点——这是arXiv上一篇cs.RO分类的最新研究,没玩虚的,全是实测堆出来的结果。

实验怎么来的?1万次抓取的数据集打底

研究团队用一台装了四个Digit 360触觉传感器的多手指机器人手,抓了200种日常物体,前后做了1万次抓取实验。每次抓取时,都同步录下三个维度的数据:外部视觉、机器人自身的本体感数据,还有指尖的触觉信号。最后把这些数据整理成公开数据集,链接是https://lasr-lab.github.io/dexterous-grasp-stability/,其他做机器人的人能直接用。

核心结论:动态触觉比视觉更能决定抓稳

他们没靠直觉下结论,而是做了严格的对比实验。先训练了端到端的时序多模态模型,用来预测机器人抬东西时会不会抓稳。结果很明确:把触觉数据加进去,尤其是那种高分辨率、动态变化的指尖触觉,抓稳预测的准确率明显提升。再拆分不同感知模态的作用,也确认了触觉是当前实验里最能提升稳定性的变量。

给行业的启发:不用硬编规则,靠数据就行

最后他们把训练好的模型当成“在线稳定门”,装在实际机器人上测。对比不用触觉的方案,用了视觉加触觉的模型后,成功抓取的比例直接涨了10.5个百分点。更重要的是,这个方法不用特意去做显式的接触模型或者力建模——这意味着不用给机器人硬编各种物理规则,靠数据就能搞定,扩展性很强。

这篇论文的价值,是把机器人抓取里一直被忽略的触觉动态数据,从“锦上添花”的补充,变成了能决定成功率的核心变量。不过,多手指机器人要真的能在超市货架、工厂流水线这种真实场景里干活,除了数据和模型,会不会还有很多没被论文提到的实际障碍?比如传感器的耐用性,或者不同物体的触觉信号怎么更通用?


素材来源:arXiv (LLM/多模态新论文) · AI情报、大模型、具身智能、科研前沿
查看报道原文

发表第一条评论吧

支持 Markdown