Featured image of post AI推理走向规模化,华为把存储推到数据中心新前台

AI推理走向规模化,华为把存储推到数据中心新前台

大规模推理让存储进入模型运行链路。

存储不再只是“放数据”

存储不再只是“放数据”

8月6日,2026华为数据存储用户精英论坛暨OceanClub嘉年华在无锡举行,华为围绕AI数据湖、AI数据平台、算力、模型和Agent五个层次,进一步阐述其AI DC数据基础设施全栈方案。

这次会议的重点并非单一存储产品升级,而是一个更基础的问题:当企业开始部署大量模型和Agent后,数据如何被统一管理、持续调用,并进入推理过程。华为公司副总裁、数据存储产品线总裁袁远提出,AI发展的关注点正从算力、模型延伸到数据。其架构中,底层是AI数据湖,向上依次是AI数据平台、算力层、模型层和Agent平台,数据安全与韧性贯穿全栈。

从数据湖到上下文记忆

企业数据往往分散在不同数据中心、服务器和业务系统中,形态也包括文本、图像、视频等。进入AI阶段后,这些数据还要经过清洗、标注、检索和转换,才能成为训练语料、知识库或Agent可调用的上下文。华为希望通过OceanStor Pacific、Omni-Dataverse等产品,把分散数据组织为统一数据空间。

更值得关注的是AI数据平台层。随着推理规模扩大,Agent运行中产生的上下文数据快速增加,仅依赖HBM显存和DRAM内存会面临容量和成本压力。HBM是GPU等加速器使用的高带宽显存,速度快但容量和成本受限;KV Cache则是大模型推理中保存注意力计算中间结果的缓存,可减少重复计算。

华为此次强调面向大规模推理、支持异构算力的上下文记忆存储CMS,并称其为一种G3.5存储。相较行业常见的G1(HBM)—G2(DRAM)—G3(本地SSD)—G4(共享存储)层级,G3.5位于本地SSD与共享存储之间,目标是在显存和内存之外提供高速、容量更大、可共享的中间缓冲层。

关键变化可以概括为:

  • 不是简单用SSD替代显存,而是把不必长期驻留显存的数据迁移出来;
  • 在千卡、万卡等大规模推理集群中,外置共享KV Cache池的收益更明显;
  • 其目标是减少重复计算,并让上下文数据在推理过程中被持续管理。

“全栈”背后的渐进式改造

过去一年,华为已陆续发布AI数据湖、UCM推理记忆数据管理、AI数据平台等技术。此次更频繁强调“全栈”,并不意味着方向突变。华为数据存储产品线相关负责人吴俊杰表示,核心仍是推动AI落地,变化在于从KV Cache、知识库、行业联合创新等单点突破,逐步整合为统一架构。

这也意味着华为数据存储产品线正在向传统存储边界外延伸。例如,ModelEngine开始覆盖模型部署以及GPU、NPU资源调度;Nexent进一步进入Agent开发和运行环境。NPU是面向神经网络计算优化的处理器,常用于AI推理和训练加速。华为试图把数据、算力、模型与Agent之间原本分散的环节连接起来。

对企业来说,更现实的问题是既有数据中心如何演进。华为给出两类路径:新建AI数据平台的客户可使用OceanStor A800;已部署OceanStor Dorado的客户,则可通过增加数据引擎节点,在保留原有存储投资基础上增加AI能力。这反映出企业AI基础设施很可能不是推倒重来,而是在传统数据库、ERP等系统仍然运行的情况下,逐步叠加AI工作负载。

AI下半程,数据重新变成生产资料

论坛上,华为和用户多次提到“AI下半程关键是数据”。这一判断的背景是:算力仍是基础,但当企业完成第一阶段算力部署、模型能力逐渐成熟后,效果差异会越来越取决于数据质量、数据组织方式和数据调用效率。

医疗场景是典型例子。过去医院只需把CT、病理片存放在各科室服务器中;如果要训练病理大模型,历史数据就必须重新汇集、治理,并转化为模型可用的数据集。科研、汽车、制造等行业也面临类似变化。过去“存下来就结束”的数据,现在要成为模型知识、Agent上下文和长期记忆。

这解释了为什么存储厂商开始讨论向量检索、KV Cache、Agent Memory,而不仅是容量和IOPS。向量检索是把文本、图像等内容转化为数学向量后进行相似度搜索的技术,常用于知识库问答和检索增强生成。

存储周期与行业走向

AI需求增长也在影响存储供应和价格。吴俊杰表示,全球存储厂商目前都受到上游供应变化影响;按当前需求情况,这一轮存储周期可能持续至2028年上半年左右。但他也强调这并非确定结论,如果AI产业热度下降、基础设施需求回归常态,价格也可能趋于平稳。

因此,AI未必让存储行业彻底摆脱周期,但确实增加了新需求:训练语料、向量数据、KV Cache、Agent上下文和长期记忆,正在扩大AI系统需要管理的数据总量。更重要的是,存储正从后台持久化设备,进入模型推理链路。未来企业评估AI基础设施时,除了算力规模,也会更关注数据能否被快速找到、上下文能保存多久,以及哪些计算可以通过记忆与缓存避免重复发生。