9月22日英特尔Connection大会上的一组实测数据,把CPU在AI时代的角色摆得明明白白:至强6+处理器在云端沙箱场景下,能支持350个沙箱并发,单沙箱延迟控制在200ms内,性能约为竞品的1.46倍。
数字AI:CPU从配角变系统中枢
很多人对AI算力的印象还停留在GPU堆参数,毕竟大模型训练靠的是大兵团并行,要的是极致吞吐量。但推理时代不一样——AI不再是“回答问题”,而是“干活”,智能体是串行状态机,每一步都依赖上一步输出,微小延迟会层层放大,用户感知直接掉下来。传统CPU追求平均吞吐的路子过时了,稳定、可控的端到端延迟,才是核心要求。
英特尔没搞单点堆料,而是重新划分数据中心架构:三类集群各司其职,CPU管智能体执行和任务编排,GPU负责模型推理,存储集群扛长对话、文档这类持续数据,集群间的数据调度全由CPU完成。落到产品上,至强6+用18A制程,有288个能效核,单颗就能部署近千个智能体。实测里,SWE-bench单智能体性能领先竞品15%;异构数据预处理上,至强AMX加速器让向量化、重排序分别达到基准的2倍和4倍;联合焱融科技基于至强6和MRDIMM的方案,拿了MLPerf Storage v3.0两项全球第一;KV Cache方面,QAT实现无损压缩,数据搬运加速9.66倍。
物理AI里,CPU是“小脑”不是陪衬
如果说数字AI战场在云端,物理AI的征途在真实世界——也就是具身智能,机器人要和环境交互,痛点是“跳舞容易,精密操作难”。传统方案里,感知、决策、控制各用一套独立单元,响应慢还容易协同偏差。
英特尔第三代酷睿Ultra搞了“大小脑融合”,把推理决策和运动控制塞进单颗SoC:CPU当“小脑”,以4kHz的控制频率,每秒做4000次动作调整,保障关节精准;GPU做高阶AI推理,Pi0.5精度下时延78ms,比人类视觉平均200-250ms反应还快;NPU管视觉感知,YOLOv12n推理仅3.55ms,每秒约280帧,远超普通摄像头60帧上限。
成本也是具身智能的大问题,某具身企业创始人说,工程师一下午训练能烧数百美元。英特尔把推理决策和运动控制整合到单SoC,压缩冗余,把整体拥有成本拉到可商业化区间。算法路线上,具身领域没统一范式,英特尔不押注单一路线,而是靠开放生态支撑多种范式迭代,联合科通工业、神州数码推开发套件,11月京东上线,开发者离机器人更近一步。
AI从“算得快”到“干得了活”,算力重心确实从训练的GPU堆,转到了推理的系统调度。x86在控制面、生态上的存量优势,刚好接住了CPU当中枢的需求。但有个问题:当异构调度成了算力核心,会不会出现新的技术壁垒,还是最终会走向更通用的架构?
素材来源:雷峰网 · AI情报、AI芯片与算力、AI智能体、AI应用落地
查看报道原文

发表第一条评论吧