Featured image of post Arm发布CSS for Mobile 2:CPU加速AI普及,GPU首次集成NPU,NPU生态留给合作伙伴

Arm发布CSS for Mobile 2:CPU加速AI普及,GPU首次集成NPU,NPU生态留给合作伙伴

Arm发布移动端AI计算平台新版本,强化CPU与GPU的AI能力,保留NPU给芯片厂商发挥空间。

Arm发布CSS for Mobile 2:AI计算底座迎来结构性重构

Arm发布CSS for Mobile 2:AI计算底座迎来结构性重构
Arm发布CSS for Mobile 2:AI计算底座迎来结构性重构|新闻截图

在Arm Everywhere China 2026大会上,Arm正式发布面向个人AI时代的新一代移动计算子系统CSS for Mobile 2。该平台不包含Arm自研NPU,而是将移动端NPU innovations交给合作伙伴主导。核心事实如下:

  • 发布时间:2026年9月9日(大会当天)
  • 新版本:CSS for Mobile 2,含新CPU集群(C2 Ultra/C2 Pro)与GPU(Mali G2-Ultra NX)
  • 硬件配置:C2 CPU集群最高支持14核心(C2 Ultra + C2 Pro组合),GPU允许配置着色器核心与NX单元
  • 软件配套:KleidiAI、神经图形模型SDK、游戏引擎插件同步更新
  • 价格与可用性:未公开具体 licensing费用,合作芯片厂商可按需定制配置
  • 权重开放:SME2技术已进入几乎所有旗舰智能手机(iOS与安卓)

CPU:面向低延迟场景,SME2成端侧AI普及主力

CPU:面向低延迟场景,SME2成端侧AI普及主力
CPU:面向低延迟场景,SME2成端侧AI普及主力|新闻截图

个人AI体验的复杂性远超“一次模型推理”——预订晚餐需完成语音识别、搜索信息、调用日历相册、执行网页操作等连续任务链。Arm C2 CPU集群针对此类负载优化:

  • 采用C2 Ultra(高响应)与C2 Pro(高能效)组合,合作伙伴可根据产品定位灵活配置核心数量
  • 单线程性能与网页浏览性能提升15%,应用启动与多线程性能提升12%
  • SME2矩阵运算加速能力使特定AI模型执行性能达上一代1.7倍

值得注意的是,Arm对CPU定位有清晰边界:等效算力约为5至6TOPS,专注低延迟应用与本地可运行的小语言模型;持续高负载推理更适合GPU或NPU。这种取舍体现了Arm对端侧真实瓶颈的认知——当内存带宽受限时,再高的峰值算力也可能被数据搬运耗尽。C2 CPU集群因此配备私有L2缓存与大容量共享L3缓存,减少DRAM访问频次。

GPU:首次集成神经网络加速器,AI重塑图形渲染范式

Mali G2-Ultra NX是Arm GPU产品线的重大突破:首次原生集成神经网络加速器(NX单元),开启“神经图形”时代。

关键创新包括:

  • 神经超级采样(NSS):以低分辨率渲染,AI重建高分辨率画面
  • 神经超级采样与降噪(NSSD):处理光追噪点
  • 神经帧率提升(NFRU):AI重建中间帧,配合Android帧节奏与游戏引擎保障交互延迟

《光影新生》演示揭示这种范式的颠覆性:八分之七的像素由AI完成重建。结果上,帧率与能效最高达上一代Mali G1-Ultra的4倍,DRAM流量最高降低70%。若不启用AI功能,GPU基础性能仍提升20%,神经图形技术打开增量空间。

GPU也可运行INT8格式的通用AI推理任务,但Arm现阶段聚焦图形优化——这与CPU专注“让AI走进更多应用”、GPU专注“让游戏体验跃升”的双路径形成互补。

为什么把NPU留给伙伴?

为什么把NPU留给伙伴?
为什么把NPU留给伙伴?|新闻截图

Arm的策略选择引发行业关注:CSS for Mobile 2未集成Arm NPU

Arm边缘AI智能终端计算副总裁James McNiven解释:“在移动设备领域,Arm一贯思路是将NPU层面的技术创新更多交由合作伙伴主导。”其逻辑在于:

对比维度Arm CPU/GPU策略移动端NPU现状
通用性标准化强,开发环境统一各厂商NPU架构异构
适配成本开发者一次适配覆盖多数设备第三方应用需逐一同步特定NPU
差异化Arm提供可配置IP芯片厂商通过NPU打造核心竞争力

手机芯片厂商通常自有NPU架构,并围绕自有模型与OS深度优化。Arm则通过CSS组合硬件IP,为伙伴缩短芯片研发周期;软件层(如KleidiAI)将SME2优化内核接入主流AI框架,让开发者无需处理底层指令即可调用硬件能力。

落地建议:技术适配需匹配场景需求

落地建议:技术适配需匹配场景需求
落地建议:技术适配需匹配场景需求|新闻截图

  • 开发者/厂商适配建议

    • 轻量级AI应用(工具调用、任务编排、小模型推理):优先关注SME2+C2 CPU组合,低延迟优势明显
    • 游戏/图形应用:可尝试神经图形SDK,尤其适合重视帧率与能效比的手游项目
    • 复杂大模型推理(如多轮对话、图像生成):仍需依赖合作伙伴NPU方案
  • 消费者购买建议

    • 重视AI响应速度与续航:关注搭载C2 Ultra/C2 Pro组合与SME2的2026年旗舰机型
    • 沉迷手机游戏:优先体验Mali G2-Ultra NX设备,神经图形技术已落地实测
    • 对第三方NPU适配有强需求:ripe待具体芯片厂商NPU生态完善后再入手

写在最后

Arm从IP供应商转向软件定义的系统级方案商,CSS for Mobile 2标志着其“硬件可配、软件统一”的AI时代策略落地。CPU、GPU、NPU的分工进化非技术饱和所致,而是对端侧真实场景的精准回应——当AI不再只是算力竞赛,计算系统的价值正转向体验与生态的协同