OpenAI 的新型 Jalapeño 推理芯片在 InferenceX 基准测试中表现优于 Nvidia 的 Blackwell,在每瓦特 AI 工作量方面提升了 1.5 倍至 1.9 倍,且延迟明显降低。这一结果至关重要,因为它可能会降低大规模语言模型服务的运营成本,并对 Nvidia 在 AI 加速器领域的统治地位造成压力。
为什么这款芯片至关重要
OpenAI 在 Hot Chips 2026 大会上展示了 Jalapeño,并强调了在硅片设计方面与 Broadcom 的合作。设计者针对当前推理流水线中最大的低效环节进行了优化:预填充(prefill)阶段的数据移动以及计算单元之间的通信。通过将键值(KV)缓存保持在本地,Jalapeño 减少了在张量(tensor)搬运上花费的时间,从而加快了 Token 生成速度并节省了能源。
亮眼的数据
- 每瓦特 AI 工作量:在峰值吞吐量下比 Blackwell 高出 1.5 倍至 1.9 倍。
- 延迟:降低了 1.7 倍至 3.6 倍,因此交互式用户的响应速度更快。
- 交互式工作负载性能:提升了 2.1 倍至 4.1 倍,这一增益直接影响聊天类应用。
这些增益体现在 InferenceX 基准测试中,Jalapeño 在该测试中也击败了 Nvidia 即将推出的 Rubin 芯片。
商业影响
OpenAI 已经在利用效率提升带来的红利来降低其 GPT-5.6 Sol API 的价格,与之前的费率相比,提供了 20% 至 33% 的折扣。更低的功耗降低了运行大规模推理集群的成本,开发者和企业都能切实感受到这一节省。
时间节点与竞争压力
Jalapeño 将在 2026 年底开始小规模出货,并计划在 2027 年进行量产。届时,Nvidia 预计将推出更新一代的 GPU,这可能会缩小差距。这种交错的发布节奏迫使 OpenAI 在竞争对手推出新芯片之前,必须证明其在现实世界中的实际效益。
反方观点
到那时,Nvidia 很可能已经在市场上推出了更新的芯片。
值得关注的方面
- 部署数据:早期客户对延迟和功耗节省的反馈将表明,基准测试数据在实际生产环境中是否依然成立。
- 定价策略:持续的 API 降价可能会迫使其他供应商转向类似的硬件,否则将面临失去市场份额的风险。
- Nvidia 的路线图:任何关于新型推理专用加速器的公告都将重塑竞争格局。
OpenAI 的全栈方法——将模型、芯片和内存结合在一起构建——为其提供了标准加速器所缺乏的杠杆。这种杠杆能否转化为持久的市场变革,取决于 Jalapeño 芯片从原型转向广泛应用的快慢,以及 Nvidia 如何应对这一效率挑战。
