Featured image of post 韩企HyperAccel 4nm AI芯片Bertha量产:768 TFLOPS FP8算力直指数据中心推理

韩企HyperAccel 4nm AI芯片Bertha量产:768 TFLOPS FP8算力直指数据中心推理

HyperAccel数据中心推理芯片Bertha在三星4nm工艺量产,提供768 TFLOPS FP8算力与高能效比。

核心事件与关键参数

核心事件与关键参数
核心事件与关键参数|新闻截图

韩国AI芯片初创企业HyperAccel宣布其数据中心人工智能推理加速器芯片"Bertha"已正式在三星晶圆代工的4nm制程节点实现量产。该消息由韩国芯片设计服务企业SEMIFIVE于9月8日对外通报。

  • 发布时间:2026年9月8日(量产启动)
  • 制程工艺:三星4nm节点
  • 芯片面积:500mm²(对应产品线Bertha 500)
  • ** FP8算力**:768 TFLOPS
  • 支持数据格式:FP16/FP8/FP4、INT8/INT4
  • 片上缓存:256MB SRAM
  • 片外内存:128GB或256GB LPDDR5X(带宽546GB/s)
  • 功耗设计:250W TDP
  • 外形规格:双槽PCIe AIC(添加卡)

产品规格与技术细节

Bertha 500作为HyperAccel面向数据中心部署的主力产品,其硬件配置体现出明显的推理优化取向。256MB片上SRAM缓存配合高达546GB/s的内存带宽,旨在缓解AI推理场景中频繁的数据搬运瓶颈。LPDDR5X作为成熟且高能效的内存方案,相比HBM方案成本更低,更适合推理任务对带宽需求相对可控的特点。

一项目标是性能与能效的双重突破。HyperAccel宣称,Bertha 500在吞吐量、成本效益、能效方面分别可达NVIDIA H100的2倍、19倍和12倍。此处的"能效"指每瓦特处理能力,“成本效益"可能包含单价与能效折算后的综合性价比。

一个值得注意的反差数据是:500mm²的芯片面积与768 TFLOPS FP8算力的组合。在先进制程下,这一算力密度表明其设计聚焦于高计算单元密度而非大型训练场景所需的大容量内存带宽,这与训练芯片动辄1000mm²以上面积、搭配HBM3显存的路径形成对比。

产品线结构与市场定位

HyperAccel采用双产品线策略:

产品型号部署场景已公开面积已公开算力(FP8)
Bertha 500数据中心推理500mm²768 TFLOPS
Bertha 100端侧部署未公开未公开

Bertha 500采用双槽PCIe AIC外形规格,这意味着其可直接部署于现有服务器机架,无需定制主机 design,降低了数据中心客户的迁移门槛。250W TDP处于主流推理加速卡的典型区间(NVIDIA L4为72W,L40为300W),兼顾性能与散热可行性。

读者落地建议

适合采用的场景

  • 需要大规模部署AI推理服务、对单卡吞吐量有高要求的云服务商与互联网企业
  • 对NVIDIA H100等高位元产品存在成本或供应瓶颈,寻求替代方案的企业
  • 关注能效比(每瓦特吞吐量)的数据中心运营方

建议再观望的情况

  • 需要兼容CUDA生态的现有AI工作负载用户,新芯片需验证框架支持程度
  • 从事大模型训练任务的用户,该芯片明确标注为"推理加速器”,未提及训练能力
  • 对内存容量有极端需求(>256GB)的应用,当前最多提供256GB LPDDR5X配置

写在最后

Bertha的量产标志着韩国AI芯片产业迈出实质性一步。其选择推理这一相对成熟的细分市场切入,规避了训练芯片所需的高_bandwidth内存与复杂互连技术壁垒,体现了务实的技术路径。若宣称的能效与成本优势经市场验证,将对数据中心AI加速格局产生实质性影响。