Featured image of post 昇腾950超节点全形态上市:千卡统一内存编址,十万亿级大模型训推一体化落地

昇腾950超节点全形态上市:千卡统一内存编址,十万亿级大模型训推一体化落地

华为发布昇腾950超节点双形态产品,实现千卡级超大模型高效训推,支持mxFP4推理与mxFP8训练。

新发布

昇腾950超节点正式商用落地

昇腾950超节点正式商用落地
昇腾950超节点正式商用落地|新闻截图

华为昇腾计算产品线于2026年全联接大会期间正式上市昇腾950超节点,成为业界最大规模商用超节点。该产品包含两种形态:

  • Atlas 950 SuperPoD液冷超节点:1024颗NPU、1300多个灵衢互联套片、4000多个光模块,面向液冷数据中心场景
  • Atlas 850E风冷超节点:支持32卡至768卡配置,兼容标准风冷机柜,无需改造即可部署
  • 关键能力:10ms级推理时延、万亿模型训推一体化、国内唯一商用支持mxFP8低精训练和全流程mxFP4推理的厂商
  • 上架时间:2026年全联接大会正式上市,该产品现已面向互联网、金融、制造、医疗等行业开放商用

打破“算力存储通信”三堵墙的技术路径

打破“算力存储通信”三堵墙的技术路径
打破“算力存储通信”三堵墙的技术路径|新闻截图

昇腾950超节点的核心突破在于软硬件协同架构设计,将成千上万张计算卡像一台超级计算机一样协同工作:

  • 芯片级创新:算子开发易用性提升,数据搬运、格式转换、通信同步、缓存策略由硬件下沉实现
  • 灵衢高速互联技术:实现1024卡统一内存编址,跨卡远程内存访问语义与本地一致,芯片互联带宽较上代提升2.1倍
  • 系统级可靠性:三重可靠设计(器件、网络、系统)支撑万卡超节点集群月级稳定训练

工程化落地层面,昇腾超节点多项设计显著提升部署可行性:

  • 正交架构设计实现柜内零线缆全电互联,单柜减少6000多根线缆,1024超节点节省约50千米铜线
  • TPSU电源模块提供储能能力,应对训练推理供电波峰
  • 多水路串联冰川铠甲冷板单块可带走2000W热量
  • 链路级重传与2+2光模块保护技术解决光模块易闪断行业顽疾

意外数据反差:f-CPC光模块液冷技术节省的电力,相当于数千户家庭年用电量——这一能耗优化指标远超行业普遍预期的“节能最大化”目标。

产品形态散热方式典型配置部署门槛核心场景
Atlas 950 SuperPoD液冷1024卡液冷数据中心大模型训练、高吞吐推理
Atlas 850E风冷32-768卡标准风冷机房企业级推理、Agent多轮交互

软件系统:为硬件装上统一调度的“大脑”

软件系统:为硬件装上统一调度的“大脑”
软件系统:为硬件装上统一调度的“大脑”|新闻截图

昇腾超节点的系统软件层实现全域资源高效协同:

  • 灵衢系统服务:支持跨物理节点统一内存编址,超节点域内Load/Store内存语义访问与单系统一致
  • 集合通信性能:基于内存语义与拓扑编排技术,1024卡域内集合通信性能提升1.6倍;1K小包通信耗时从70微秒降至8.6微秒(8倍性能提升)
  • 软件生态:CANN与Mind系列已完成全面开源,CANN社区月活开发者超5200人,稳居中国开源项目活跃度榜首

落地建议

落地建议
落地建议|新闻截图

  • 适合立即部署的场景:

    • 已建设液冷基础设施、需训推一体化的超大模型团队(选择Atlas 950 SuperPoD)
    • 中小企业现有机房为风冷环境、需低时延Agent推理(选择Atlas 850E)
    • 需全流程支持mxFP4推理、mxFP8训练的低精度计算需求
  • 建议再观望的场景:

    • 仍需高性能GPU兼容支持的现有推理管道(昇腾生态仍在构建阶段)
    • 预算紧张且模型规模小于千亿级的小型团队(超节点单位成本尚不透明)

写在最后

昇腾超节点以“硬件架构+系统工程+软件生态”三位一体的落地能力,将超节点从技术构想变为可规模商用的基础设施。其双形态设计兼顾极致性能与部署灵活性,为十万亿级大模型时代提供了阶段性最优解。

写在最后,超节点竞争已从参数比拼转入真实场景验证阶段,能否实现"千卡如一机"的稳定运行,将成为衡量AI基础设施成熟度的核心标尺。