9月16日,WorldArena2.0挑战赛全球终榜落定,三条赛道总奖金7000美元,把世界模型领域的核心问题——“能不能被机器人真正用起来”,摆到了台面上。
从“画视频”到“用起来”,评测到底改了啥?
WorldArena是世界模型领域最权威的评测体系之一。1.0版本还停留在测视频生成质量、仿真里的离线任务,对机器人最在意的“真机交互、连续学习、视触觉反馈”完全没覆盖。2.0直接补了这几块:模态从纯视觉加了触觉,功能从离线扩到在线强化学习,平台从仿真伸到真实机器人。三条赛道对应三个核心需求:Track1测视频质量(70个任务,50个分布内、20个分布外场景),Track2测能不能当RL的训练环境,Track3直接测真机操作(AgileX双臂、Franka单臂,分视触觉和纯视觉任务)。
三条赛道揭榜:技术路线的第一次正面碰撞
终榜结果很有意思,前两名都是学院派和产业派各占一席,正好对应世界模型的两大主流路线。
Track1是JEPA vs空间智能的直接对话:视启未来的WorldIncept(JEPA路线)拿72.33分第一,同济大学BWM-Turbo(空间智能路线)71.49分第二,差0.84分。分项里,WorldIncept赢在物理遵循、3D准确,BWM-Turbo赢在背景一致性和JEPA表征相似度。
Track2是在线RL的试金石:北京中关村学院的MW2拿72.93分第一,晨昏线科技的TTWM72.40分第二,差0.53分。MW2侧重机器人对物理规律的理解,TTWM重点建模动作和未来状态的因果关系,还优化了多轮交互的误差累积。
Track3是真机的终极考验:小米的ViTacX拿76.64分总第一,上海科技大学的OmniFlow67.37分第二。ViTacX纯视觉任务拿了85分第一,但视触觉任务只排第三,OmniFlow在两类任务里都稳在第二。
落在真机上的,到底是哪些硬指标?
之前的世界模型比拼,很多时候“画面好看”就能占优,但这次不一样。Track1的核心已经不是视频,而是“生成的东西是否符合真实物理规则、空间关系”;Track2看的是“连续交互中会不会把偏差越带越大”;Track3则直面真机的麻烦:传感噪声、通信延迟,还有动作出错后的自恢复能力。
这是世界模型第一次在真机环境下的公平对决,之前的技术路线优劣,现在要靠落地能力说话。当JEPA的隐空间和空间智能的长时记忆都要接受真机的“噪音、延迟、误差”考验时,哪条路线会最先跑出量产级的世界模型?
素材来源:雷峰网 · AI情报、具身智能
查看报道原文

发表第一条评论吧