星光澄海 | BLOG

Imagination E系列:AI超分2.3毫秒 Prefill性能提4.7倍

单核Imagination E系列,把540p画面拉到1080p,只用2.3毫秒。

游戏里的AI超分:少搬数据,快出画面
以前做AI超分,得让GPU和NPU搭伙干活:GPU先渲染,结果存到DDR里,NPU再读出来做超分,完了再写回去——数据来回搬,慢不说还费电。E系列直接让GPU自己扛下图形计算和矩阵运算,把两类单元的“最后一公里”打通,图形数据就近进矩阵运算,不用绕远路。
再加上它自研的压缩技术,神经超分算法里的权重能减一半,模型要存要读的数据少了,速度自然上来。具体到游戏里,单核E系列拉到1080p只花2.3毫秒;4K分辨率下,带宽消耗最高降54%,帧率能到对照方案的2.5倍。还有它沿用的TBDR分块渲染,把整帧拆成小块逐块处理,中间数据留在片上,和AI能力一结合,数据进出内存的次数又少了。这些优化堆起来,还带来最高39%的每瓦性能提升。

大模型推理:Prefill提速4.7倍的关键
现在终端AI忙得很,像Agent这类应用,核心是大语言模型推理,分Prefill和Decode两个阶段:Prefill影响首Token延迟,Decode关乎每Token输出速度。E系列加了MXFP8、MXFP4低精度支持,刚好适配这两个阶段的需求——低精度能提高矩阵运算吞吐,让Prefill更快。按Imagination的测算,对比上一代,E系列的Prefill性能提升了4.7倍。
除了矩阵运算,E系列还强化了卷积计算能力,性能是上一代的4.4倍,刚好对应多模态AI里的视觉感知、图像处理这些任务。它的带宽也能跟上不同内存:通过AXI接口接入,适配LPDDR、GDDR、HBM,最高能跑768GB/s的读取带宽。

不是替代,是异构计算里的“搭子”
有人会问:GPU能做AI,那NPU是不是要被淘汰?Imagination的答案是“不是”。E系列的软件栈是通用的,开发者能用OpenCL、Vulkan写计算内核,也能接Llama.cpp、ONNX这些上层工具,不用每换一代就重新适配。
但实际部署里,不同任务还是有专属的最优计算单元:Agent里CPU管调度,GPU或NPU算模型;自动驾驶里,GPU只是异构SoC的一环,还要和感知、控制单元配合。E系列也为此做了准备:用硬件mailbox传状态,共享内存减少数据拷贝,客户还能把GPU软件集成进自己的SDK,让系统按需调用不同资源。
Imagination的逻辑很简单:不用追求全占,而是让GPU在融合计算里发挥最大作用。

如果未来终端GPU的AI能力足够覆盖更多AI任务,你觉得会有SoC厂商敢放弃专用NPU吗?


素材来源:雷峰网 · AI情报、大模型、AI芯片与算力
查看报道原文

发表第一条评论吧

支持 Markdown