星光澄海 | BLOG

端侧与物理AI兴起,芯片行业遇上新考题

2025年全球人形机器人装机量中,中国占比已超80%;IDC数据显示,当年中国具身智能机器人用户支出达14亿美元,预计2030年将达770亿美元,年均复合增长率约94%。

AI不再追“规模”,要往实处落

之前两年,AI圈聊的全是“规模”——更大的模型、更多参数、更贵的训练集群。但2025到2026年,风向悄悄变了。端侧AI、物理AI成了新焦点,AI要从数据中心的恒温机房,走到人的口袋、车间、街头。这些场景哪有稳定供电、充沛带宽?电池有限、网络时断时续、要求实时反应,全是硬约束。
Figure AI最近的研究印证了落地的难:机器人在训练场景的表现还行,但换个环境成功率只有9%;用特殊训练方法、调整数据采集和模型架构后,新场景成功率升到56%,可离“可部署、可复制、可量产”还差得远。
英特尔的王景佳说过个实例子:川西跑车载导航,无网弱网下经常失灵,碰上复杂路况,用户体验直接拉胯。不止如此,视源股份的王玉龙算过账:现在Token单价降了,但上下文在快速扩张,他们每月的AI账单“非常恐怖”,端侧部署能省不少成本,还能保隐私——比如视源的“课堂观察”,学生数据本地脱敏,只传脱敏后的内容,符合未成年人隐私要求。

芯片遇上的三道新考题

端侧和物理AI起来,芯片厂商要应付的事变多了,核心是三个考题:
第一是“边境税”——数据搬运的成本。Imagination的CEO马库斯·莫森说,现在芯片里的GPU、DSP、NPU各是“孤岛”,靠外部内存来回传数据,这成本贵得像“边境税”。比如神经超分辨率,要是GPU出了图形,AI再加工,得写回DDR再读,代价很高;Imagination的解法是把AI直接放进图形管线,NSR技术能让540p转1080p时,1GHz单核GPU延迟低到2.3毫秒,内存带宽直接减半。
第二是prefill和decode的取舍。本地大模型要分预填充和解码两个阶段,关键指标是TTFT——处理器听懂问题、吐出第一个token的时间。Imagination实测:车载导航0.2秒、150tokens/s,盲人智能眼镜0.25秒、153tokens/s,邮件解读0.86秒。但decode阶段靠带宽,就算TOPS再高,带宽不够也白搭。
第三是综合平衡。现在不是堆TOPS就行,要匹配场景。视源的王玉龙说,课堂观察场景,用32-48TOPS就够,没必要搞大模型;还有端侧设备要扛7×24小时、低功耗、防尘防震这些,跟消费级不一样,而且现在很多工作负载是CPU在做,混合式的情况越来越多。

XPU架构,试解混合AI的题

英特尔的思路是XPU,给不同负载配不同算力:CPU管智能体的编排调度,NPU管视觉感知这类专用负载,GPU管世界模型、VLA这类大模型推理。这是英特尔押注的方向,也有实际案例:跟派兹互连合作,做Agent Box方案,用锐炫Pro B70,根据客户的并行情况和工作负载调校模型、适配算法。
王景佳说,未来1-2年核心方向两个:一是做云边端都能调度算力的混合AI方案;二是芯片要快速迭代,跟上AI的快节奏,还要跟生态协同。

过去数字AI时代,比谁的模型大;现在物理AI时代,比谁能把AI落地。那你觉得,下一个让芯片厂商跑通核心场景,会是车间的机器人,还是口袋里的智能设备?


素材来源:钛媒体 · AI情报、AI芯片与算力、AI应用落地、具身智能
查看报道原文

发表第一条评论吧

支持 Markdown