Featured image of post OpenAI“小辣椒”芯片首秀:SemiAnalysis实测能效与延迟领先Blackwell

OpenAI“小辣椒”芯片首秀:SemiAnalysis实测能效与延迟领先Blackwell

小辣椒工程样品实测领先Blackwell

OpenAI自研芯片“小辣椒”正式登场,第一代产品即具竞争力

OpenAI自研芯片“小辣椒”正式登场,第一代产品即具竞争力
OpenAI自研芯片“小辣椒”正式登场,第一代产品即具竞争力|新闻截图

OpenAI于2026年8月25日在Hot Chips 2026大会上公开其自研推理芯片“小辣椒”(Jalapeno)。半导体研究机构SemiAnalysis受邀到OpenAI实验室,使用自家InferenceX基准套件进行了现场验证。以下是关键事实要点:

  • 发布时间:2026年8月25日公开亮相
  • 芯片状态:工程样品已就绪,量产预计2027年逐步爬坡,主要产出集中在2027年底
  • 功耗规格:热设计功耗(TDP)为700W
  • 性能对比:在多个开源模型上击败SemiAnalysis可测到的英伟达、AMD和谷歌芯片
  • 合作方:与博通(Broadcom)合作设计
  • 部署计划:与neocloud厂商合作,先收集可靠性数据再逐步放量

实测数据:能效与延迟双项领先

实测数据:能效与延迟双项领先
实测数据:能效与延迟双项领先|新闻截图

根据SemiAnalysis现场验证数据,小辣椒在三个主流开源大模型(GPT-OSS 120B、DeepSeek R1 670B、月之暗面Kimi K2.5 1万亿参数)上展现出明显优势:

  • 每瓦吞吐量:达到英伟达GB200 NVL72、GB300 NVL72机架系统的1.5-1.9倍
  • 推理时延:端到端时延比英伟达记录的GB200 NVL72、GB300 NVL72最佳成绩低1.7-3.6倍,超低延迟场景快2.1-4.1倍
  • 峰值吞吐对比:在GB300最快输出速度设置下,每千瓦吞吐最高高出8.6-104.3倍
  • 单用户吞吐:低并发下,GPT-OSS和Kimi K2.5约1400 token/秒/用户,DeepSeek R1在并发1时超过700 token/秒/用户
  • 正确性:GSM8k评测结果与英伟达芯片持平

需要注意的是,上述成绩基于单token预测(STP),没有使用推测解码,也没有做prefill、decode分离;对比的Blackwell成绩则开启了多token预测(MTP)。SemiAnalysis称,如果与开启MTP的GB300对比,峰值能效优势会缩至约1.5倍

此外,跑分数字由OpenAI提供,SemiAnalysis团队在实验室现场验证了InferenceX的跑分过程,但没有跑完整套件,也没有测试其更偏好的AgentX长上下文多轮对话负载。因此,这组数据更适合被视为工程样品在特定测试条件下的强势表现,而不是生产环境的最终结论。

技术突破:AI辅助设计与高速迭代

小辣椒的设计在2024年年中启动,2025年11月完成流片(CoWoS封装设计),实际芯片点亮约用3个月,9个月拿出A0步进成绩。第二版B0步进已经进厂流片,预计每瓦性能还能提升约25%

关键规格

  • B0步进采用台积电N3P工艺单计算die,配N3E工艺I/O chiplet
  • MXFP4算力达13.4 PFLOPS
  • 六组HBM4高带宽内存,单封装216GB容量、15.4TB/s带宽,原文称这是目前已出货或接近出货加速卡中的最高水平,供应商大概率是三星
  • 软件栈基于Triton的Gluon语言编写,保留SPMD编程模型,同时暴露更底层抽象

AI深度参与设计:Codex与GPT-Astra辅助下,SIMD单元面积缩减8%,矩阵引擎面积缩减10%;部分AI编写的内核比人类专家内核快1.5-1.8倍

此外,OpenAI用Codex将《毁灭战士》移植到这颗芯片上,运行帧率可达36 FPS

整体系统:Vindaloo机架与部署规划

整体系统:Vindaloo机架与部署规划
整体系统:Vindaloo机架与部署规划|新闻截图

承载小辣椒的单机架系统名为“Vindaloo”,规格如下:

项目参数
单机架芯片数128颗小辣椒
主机架构Katsu CPU主机架 + Chana交换机架
双机架功耗约160kW
扩展能力最多16个机架、2048颗芯片组成一个scale-up域
目标规模下一阶段目标100MW

重要声明:OpenAI目前并不打算用小辣椒替代其现有的所有芯片系列,仍将继续与英伟达算力伙伴合作;同时,OpenAI也会继续开发第二代和第三代芯片。

行业影响与落地建议

行业影响与落地建议
行业影响与落地建议|新闻截图

英伟达股价反而上涨2.19%。原文给出的可能原因有两个:一是英伟达同日发布了Jetson Orin Nano 2机器人电脑;二是OpenAI在小辣椒跑分公布后仍明确表态不会弃用英伟达,训练仍大量使用英伟达芯片,且双方存在融资担保合作。

读者建议

  • 推理密集型开发者:如果关注超低延迟与能效比,可继续跟踪2027年量产爬坡后的OpenAI生态接口与可用性
  • 企业采购决策者:当前阶段仍需观望,小辣椒尚处工程样品阶段,生产环境稳定性和真实负载表现还需要验证

写在最后

小辣椒的快速落地预示云基础设施竞争进入新阶段。值得玩味的是,原文提到,跑在英伟达GPU上的GPT 5.6 Sol也参与了这颗芯片的设计,而它可能会挑战CUDA生态护城河。AI本身正在成为芯片设计迭代的加速器。

英伟达股价不跌反涨,也说明市场未必只按“替代”逻辑定价;在OpenAI继续依赖英伟达训练算力的情况下,生态协同和短期供需仍然同样重要。