核心事件:Jalapeño首次公开跑分,推理阶段硬件分化加速

OpenAI于近日首次公开其自研推理芯片 Jalapeño 的实测数据。该芯片面向大模型在线推理场景,重点关注 Token 吞吐、生成延迟与单位功耗效率三大指标。据公开信息,芯片额定功耗为 700W,运行中持续功耗未超 550W。
关键事实一览:
- 芯片代号:Jalapeño(日文意为“墨西哥辣椒”,命名延续 OpenAI 辣味芯片系列)
- 测试模型:GPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T
- 性能提升:单位功耗吞吐量提升 1.5~1.9 倍;端到端延迟降低 1.7~3.6 倍;交互场景提升达 2.1~4.1 倍
- 部署状态:仍处于生产资格验证与规模部署前阶段;未依赖 speculative decoding 技术
值得注意的是,此次数据并非单一峰值性能,而是覆盖了 Prefill(预填充)与 Decode(解码生成)两个阶段——这恰恰揭示了行业对推理负载的重新认知。
技术底层:Token 成本取代 FLOPS 成为新坐标

大模型上线后,芯片负载已从离线训练转向持续在线服务:ChatGPT 完成逐轮问答,Reasoning 模型生成长链路输出,Agent 串联多次调用。此时,芯片需面对两种截然不同的计算模式:
- Prefill 阶段:输入 Prompt(如 8K Token)后可大规模并行计算,权重被大量 Token 重复利用,算术强度高,易受计算单元限制。
- Decode 阶段:新 Token 逐个生成,依赖前序状态(KV Cache),并行度骤降但权重与 KV Cache 访问频次极高,内存带宽与数据移动成瓶颈。
Roofline 模型清晰呈现这一矛盾:在低 Batch 解码中,算术强度粗略仅约 2/b FLOPs/Byte(b 为参数字节数),模型参数量增加无法改善 Decode 瓶颈。Jalapeño 的设计即围绕此现实:强调 KV Cache 显式布局、数据局部性保持及芯片内计算-内存-网络协同,采用同构架构兼顾 Prefill 与 Decode,无需提前划分资源池。
多家巨头路线分化:专用化 vs 异构化
Jalapeño 并非孤例,大模型推理硬件正走向结构性分化:
NVIDIA 方案:在 Vera Rubin 系统中引入 Groq 3 LPU 实现“分工驾驶舱”。GPU 专攻 Prefill(大矩阵、高并行优势),LPU 主理 Decode(低延迟需求)。Groq 3 LPX 机架含 256 颗 LPU,仅配 128 GB SRAM(对比 GPU 的 HBM),但 SRAM 聚合带宽高达 40 PB/s;LPU 采用确定性执行架构,省去传统硬件流控机制。这种异构设计揭示反差:当业务仅追求总吞吐且容忍高延迟时,Rubin GPU 仍有效率;单用户 Token 延迟要求提升时,LPX 才显现优势,但 LPU 增多反而降低总体吞吐效率。
Google 方案:在 TPU 8 时代直接划分 TPU 8t(训练)与 TPU 8i(推理)。内容显示:TPU 8i 比 8t 多 2 组 HBM(共 8 组),并增加 SRAM 容量;网络拓扑支持 BoardFly(路径上限 7 hops),而 8t 的 3D Torus 路径可达 16 hops,辅以 Collective Acceleration Engine 减少芯片内数据移动。
三者共性:均不再追求单一芯片“全能”,而根据 workload 特性调整资源比例——推理芯片更倾向 HBM 带宽、SRAM 容量、低延迟网络与 KV Cache 管理能力;训练芯片则重算力与大规模互联。
选型建议:按负载特征匹配硬件
适合即刻评估 Jalapeño 的场景:
- 部署交互敏感型服务(如实时客服 Agent),对 Token 延迟敏感
- 关注单位功耗推理成本(Tokens/kW)的数据中心
- 计划部署中长上下文(128K+ Token)但暂未部署专用异构系统的团队
建议继续观察或等待的场景:
- 业务极度依赖高吞吐 Batch 统一处理(如离线批处理),Rubin GPU 当前仍具成本优势
- 已投入 Groq 或 TPU 生态的厂商,需评估跨平台迁移成本
- 尚未验证长上下文 KV Cache 搬运 overhead 的 AutoML 场景
写在最后
Jalapeño 的跑分数据印证了行业共识:推理阶段的“瓶颈已从算力转向数据供应”。当 FLOPS 吞吐不再能准确衡量线服务效率,Tokens/s/user、TTFT(首 Token 时间)、TBT(Token 间隙吞吐)等指标的崛起,标志着芯片设计逻辑从“算得快”转向“送得快”。硬件分割的细节尚未定型,但方向已然清晰——未来的 AI 芯片竞争,将取决于对 Token 全链路成本的精细切割能力。


