8月19日,宇树科技科创板敲钟,发行价150.8元开盘直接摸到1100元,629%的涨幅把盘中市值推到4449亿。到9月18日上市满月,股价较首日高点回撤53%,市值蒸发2366亿——相当于三分之一个小米。二级市场在撤,一级市场却狂热:2026年上半年国内具身智能融资935亿,是去年同期的5倍,估值过百亿的公司从3家涨到20多家。SAG数据更直接:上半年全球人形机器人出货1.91万台,中国占97%,智元一家就拿了44%的份额。
很多人把具身智能简单理解成“AI加个身体”,这认知太浅了。伯克利ROAR主席Allen Yang说,它的本质是“把智能放进物理形体里”——扫地机器人、自动驾驶车都是具身智能,人形只是外界最容易想象的终极形态。
卡脖子的,不是大脑是小脑
业内共识的五层技术栈:硬件、感知、小脑(运动控制)、大脑(规划)、训练。不少人盯着“大脑”的大语言模型,其实真正卡脖子的是小脑。亦庄半马今年冠军跑出50分26秒,比人类男子半马纪录快近7分钟,可这是专为跑步优化的下肢设计。机器人的手至今连拧开瓶盖都费劲,更别说在陌生空间里独立开门、使用未知工具——这些全是小脑要负责的动作控制。小脑划定了身体能做的动作区间,大脑再强,也只能在这个区间里挑选、组合动作。
莫拉维克悖论,藏在小松鼠的爬树里
机器能考律师、写代码,却叠不好被子,这是莫拉维克悖论。Allen Yang说这不是悖论,是行为智能的缺口。小松鼠没语言,却能爬任意树、吃任意果,因为它的DNA是个“预训练模型”,不用从零学动作。机器人没有这个“基因级预训练”,学爬楼梯、叠被子要从零开始,少样本学习能力至今没达标——这才是当前最难突破的地方。
世界模型,不是所有场景的刚需
现在不少团队从VLA(视觉-语言-动作模型)转向世界模型,想让机器人先模拟物理世界演变再行动。Allen Yang明确,世界模型只在拿不到数据的场景里值钱:自动驾驶有几百万辆车在路上跑,数据足够多;工厂有标准化规则,不用模拟;只有私人家庭,每家装修、布局不一样,不可能公开采集数据,才真正需要世界模型。
最后留个问题:当我们给机器人装“小脑”时,要不要放弃“完美人形”的执念,先让它们在扫地、帮拿东西这些小事上跑通,再谈人形保姆?
素材来源:钛媒体 · AI情报、具身智能
查看报道原文

发表第一条评论吧