Featured image of post 三星提出AI响应速度10倍跃升计划:zHBM内存直连加速器消解数据传输延迟

三星提出AI响应速度10倍跃升计划:zHBM内存直连加速器消解数据传输延迟

三星发布zHBM内存方案,目标将AI系统每秒词元处理量从100提升至1000。

核心事件速览

三星电子于2026年9月16日在美国加州圣克拉拉举行的"AI 基础设施峰会"上,正式披露其下一代AI内存技术zHBM的路线图,旨在将AI加速器的响应速度提升10倍。硬性指标与时间线如下:

  • 发布时间:zHBM已于2026年8月(峰会前一个月)发布;zNAND-O三维存储方案预计2028年起提供样品
  • 核心目标:AI系统每秒词元处理量从当前100 Tokens/user提升至1000 Tokens/user
  • 性能提升:zHBM架构理论峰值性能可达HBM5的8倍,能效达3倍
  • 关键架构:zHBM将HBM直接垂直堆叠在AI加速器上,摒弃传统水平布线

技术突破与行业反应

传统AI系统中,内存与处理器分离布局导致数据移动延迟高、能耗大。金仁东(Samsung DSA存储产品规划高管)采用"酒店客房直达大堂的专用电梯"比喻zHBM设计——该设计消除了数据传输中的"等待电梯"延迟,为实时推理任务提供低时延路径。

值得注意的反差数据是:尽管zHBM性能指标突出,作为HBM补充方案的CXL(Compute Express Link)技术却在峰会上受到质疑。OpenAI研究员丹尼尔·莫里斯明确表示:“就AI模型的实际运行而言,我找不到CXL能用在哪里”,其唯一可能用途仅限于存放极少调用的冷数据。

英特尔SoC架构负责人维迪娅·蒂亚加拉詹进一步指出:“CXL整合内存确有辅助价值,但它无法替代HBM;GPU间通过CXL传输数据的速度远低于HBM。“这一观点揭示了高带宽场景下实测性能的巨大落差。

技术对比:HBM vs CXL定位差异

维度HBM(含zHBM)CXL
物理结构通过硅通孔(TSV)垂直堆叠于处理器旁通过接口水平连接内存模块
带宽水平zHBM理论峰值为HBM5的8倍显著低于HBM,适合容量扩展而非带宽需求
典型用途AI模型热数据、实时推理、权重矩阵高速读取服务器内存扩容、冷数据存储、跨服务器共享内存
主导厂商Samsung, SK HynixIntel-led, broad industry support

该对比表明,CXL更多承担"辅助性记忆扩展"角色,而高并发推理所需的带宽仍依赖HBM及其演进版本。

用户落地建议

  • 适合立即跟进者:AI芯片设计团队与大模型推理平台服务商。若业务依赖实时对话响应(如客服机器人、AI助手),zHBM的低延迟设计可显著改善用户体验,建议密切跟踪三星2027-2028年量产进展。
  • 建议再等等者:预算敏感型AI初创企业。当前HBM成本高、供应紧张;CXL虽性能不足但可能提供更低成本方案。若非实时推理刚需,可等待2028年zNAND-O等替代方案成熟后评估。

写在最后

这场峰会揭示了一个清晰趋势:AI算力瓶颈正从计算单元转向内存子系统。当摩尔定律趋缓,通过3D堆叠重构内存-处理器拓扑结构,成为延续性能增长曲线的必由之路——三星等存储巨头正从"货架部件"供应商转向算力架构的关键定义者。