Featured image of post GPU集成AI算力:神经核实现540p→1080p超分仅2.3ms

GPU集成AI算力:神经核实现540p→1080p超分仅2.3ms

Imagination推出E系列GPU IP,整合神经核与低精度计算,Prefill性能提升4.7倍。

新发布

核心事件:E系列GPU IP正式亮相

核心事件:E系列GPU IP正式亮相
核心事件:E系列GPU IP正式亮相|新闻截图

Imagination Technologies于近日举办E系列GPU IP产品展示会,发布全新一代面向终端AI计算的GPU解决方案。该系列聚焦图形、计算与AI能力的统一架构整合,核心硬信息如下:

  • 发布时间:2026年9月近期(未披露具体日期)
  • 关键产品:E-Series GPU IP(单核与多核配置)
  • 发布时间与可用性:演示已进行,未公布具体量产时间表
  • 权重开放:信息未披露,但强调软件栈支持跨代迁移复用

架构革新:GPU自研神经核,减少数据搬运

架构革新:GPU自研神经核,减少数据搬运
架构革新:GPU自研神经核,减少数据搬运|新闻截图

E系列最显著的突破在于将Neural Core(神经核)深度整合进GPU异构架构。Neural Core是专用于矩阵运算的计算单元,其意义不仅在于提升AI算力,更在于改变数据流动路径——传统方案中GPU负责渲染、NPU负责超分,中间结果需经DDR内存中转;而E系列让GPU独自完成渲染与神经超分重建,数据无需进出片外内存。

关键性能指标:

  • 单核E系列将540p画面提升至1080p,仅耗时2.3毫秒
  • 同配置下拉升至4K时,带宽消耗最高降低54%,帧率达对照组2.5倍
  • 每瓦性能提升最高达39%

这一效果得益于三重优化:TBDR(基于分块的延迟渲染)让中间数据留在片上;自研神经超分算法通过压缩技术降低超50%权重数据量;ALU执行机制改造实现"最大化数据复用、最小化不必要的数据搬运"。

AI推理能力:Prefill阶段性能跃升4.7倍

E系列首次引入LLM推理常用的MXFP8/MXFP4低位宽格式硬件支持。低位宽设计直接提升矩阵运算吞吐效率,尤其利好大语言模型Prefill阶段——该阶段负责处理输入上下文生成首个Token,直接影响TTFT(Time To First Token,首Token延迟)。

性能对比:

  • Prefill阶段性能提升4.7倍(相比上一代产品)
  • 多模态卷积计算性能达上一代4.4倍,应对视觉识别与传感器处理

值得注意的是, Decode阶段虽同样受益于权重数据量减少带来的带宽压力缓解,但实际表现仍受限于SoC集成的内存子系统配置。E系列通过AXI接口支持LPDDR/GDDR/HBM等多种内存,最高可支持768GB/s读取带宽。

软件生态与异构协作:GPU不是孤岛

软件生态与异构协作:GPU不是孤岛
软件生态与异构协作:GPU不是孤岛|新闻截图

E系列保留了GPU的通用性,开发者可通过OpenCL、Vulkan编写计算内核,或接入Llama.cpp、ONNX、PyTorch等上层框架。Imagination强调其跨代统一的软件栈设计,使针对E系列的优化工作可延续至未来产品。

在实际SoC部署中,CPU、GPU、NPU形成协同体系:CPU负责任务协调与流程管理,GPU承担图形与AI加速,NPU处理特定低功耗推理任务。E系列通过硬件mailbox传递指令、共享内存减少数据拷贝、支持GPU软件集成进客户SDK,实现灵活分工。

适配建议与落地指南

适配建议与落地指南
适配建议与落地指南|新闻截图

适合立即关注的用户:

  • 消费电子芯片设计厂商:需要在有限面积内平衡图形与AI性能
  • Agent PC与边缘计算方案商:关注TTFT延迟与能效比
  • 汽车与机器人企业:寻求统一架构降低软件维护成本

建议再观望的场景:

  • 专用于NPU推理的嵌入式设备:若AI负载高度固定且无需图形能力,独立NPU可能更具成本优势
  • 需要HBM3E等顶级内存接口的超高端应用:E系列最高768GB/s带宽接近GDDR6水平,但未达HBM3E上限

写在最后

当AI负载从云端向端侧迁移,SoC designers面临算力整合的难题。Imagination选择让GPU而非新增独立NPU承担更多工作,其价值不在于某项参数的绝对领先,而在于用同一套硬件与软件体系,降低端侧AI部署的总拥有成本——从设计复杂度、验证周期到长期维护,这或许才是E系列真正试图验证的商业路径。