随着具身智能、自动驾驶、AI PC等物理AI形态快速落地,端侧AI的工作负载已从单一的推理计算,延伸为感知、建模、推理、决策、渲染全链路协同的一体化任务。传统芯片“专用加速器堆叠”的碎片化架构,正面临能效损耗、时延高企与开发成本激增的多重瓶颈。日前,Imagination Technologies 举办E系列产品展示会暨媒体日活动,提出的“融合计算”架构路线,不仅回应了端侧AI芯片的当下痛点,更力图重新定义GPU在端侧智能时代的核心价值。

物理AI“边境税”催生融合计算大势
物理AI时代的典型特征,是智能任务不再是孤立的计算节点,而是贯穿终端设备的完整闭环。在手机、智能汽车、机器人、工业摄像头等设备中,环境感知、模型推理、行为决策、画面渲染共享同一条数据路径、同一个响应时限、同一套内存与功耗预算。但在硅片层面,传统架构仍停留在“专用加速器各司其职”的碎片化阶段:CPU负责调度、GPU负责图形、DSP负责信号处理、NPU负责神经网络推理,每个模块都是独立的计算孤岛。
Imagination CEO Markus Mosen在演讲中将这种跨模块数据交互的成本称为“边境税”,并指出其存在三重代价:一是能耗成本,数据在不同计算单元与外部内存间反复搬运,消耗大量功耗;二是时延成本,跨模块数据传输与调度带来的延迟,难以满足实时任务的响应要求;三是工程成本,每套加速器都需要独立的工具链、驱动程序与安全模型,大幅拉长研发周期、提升维护成本。
因此,行业必然走向融合破局之路,CPU逐步加入向量与矩阵运算扩展,NPU开始增强可编程能力,GPU则不断吸收高算力AI计算与神经渲染能力。在这一趋势下,整个系统需要一个共享、可编程的计算重心,以此减少数据跨域搬运、提升资源利用率、降低系统复杂度。
Markus Mosen认为,在所有计算单元中,GPU是最有条件成为这一融合的核心的。GPU具备多个优势:首先是天生具备可编程性,大规模并行架构天然适配高并发的AI与图形计算;其次是已在全球边缘市场实现规模部署,覆盖数十亿台终端设备;第三是拥有成熟的软件生态,驱动、工具链、开放标准与开发者体系完整;第四,图形渲染是所有带显示终端的刚需,任何智能设备都无法舍弃图形能力。其他计算单元若要承担融合重心的角色,至少需要补齐上述其中一项能力,而GPU已全部具备。
发布E系列争取AI端侧核心
基于“GPU作为融合计算核心”的判断,Imagination在本次活动上推出新一代E系列GPU IP,核心创新是将矩阵乘法加速器深度嵌入GPU统一着色器集群内部,与图形算术单元紧邻排布,而非作为独立的AI计算模块存在。这一设计让AI计算得以完整复用GPU的寄存器、控制逻辑、缓存、内存层级、固件、驱动及工具链体系,实现对既有GPU生态投资的高杠杆复用。
根据Imagination首席营收官Jake Kochnowicz的介绍,在核心算力指标上,E系列在1GHz主频下,单核可提供2 TFLOPS的FP32图形算力;对应矩阵运算场景,单核FP16/BF16算力达16 TFLOPS,INT8/FP8/FP4算力达32 TOPS。在四核顶配配置中,FP16算力可突破100 TFLOPS,FP8算力超过200 TFLOPS,整体AI性能较上一代D系列提升4倍以上。
在实际工作负载中,E系列的基础AI算子性能实现大幅跃升:矩阵乘法性能提升4.8倍,卷积性能提升4.4倍,矩阵工作负载下GPU利用率可达 89%。在图形渲染中,每TFLOPS算力对应的游戏帧率较上一代提升54%,四核配置可在《博德之门 3》《古墓丽影:暗影》等3A大作中实现60fps以上的流畅表现。
此外,Imagination推出的NSR神经超分辨率技术,实现了图形与AI的真正深度耦合。依托 E系列矩阵加速器深度嵌入GPU的架构,开发者仅需编写一套基于Vulkan或OpenCL的着色器程序,即可在单遍渲染流程中同步完成图形计算与AI超分处理,从根源上消除了跨模块数据搬运的成本。
端侧AI市场GPU或将迎来价值重估
随着AI PC、智能座舱、具身机器人、工业视觉等场景的快速渗透,端侧AI算力需求正进入爆发增长期。与云端追求极致峰值算力不同,端侧场景对能效、集成度、软件灵活性、硬件全生命周期迭代能力的要求更高,这恰恰是GPU作为融合计算核心的核心优势。
中国市场是全球端侧AI发展的核心引擎之一。Jake Kochnowicz表示,中国市场对GPU性能与功能的迭代速度要求更高,对图形与通用计算的需求也更旺盛,正在持续推动GPU IP的能力边界突破。新一代 E 系列将进一步深耕桌面市场,同时拓展车载、边缘计算、具身智能等新兴场景,与中国合作伙伴共建开放生态。
从行业趋势来看,端侧芯片正在经历从“堆料”到“融合”的转向。随着AI应用快速迭代,多套加速器对应多套软件栈的复杂度成本,已经逐渐超过硬件本身的成本。越来越多的SoC 厂商开始探索用GPU承载更多AI任务,替代部分独立NPU,以此简化系统架构、降低开发与维护成本。而GPU可编程性能够适配AI模型与算法的快速演进,让硬件在整个生命周期内持续兼容新应用,有效延长产品寿命。

