OpenAI 发布了其自主研发的推理芯片 Jalapeño,并表示其每千瓦吞吐量高达 Nvidia GB200 和 GB300 加速器的 1.9 倍。该团队仅用九个月时间就将概念转化为了可工作的硅晶片——这远快于定制 AI 处理器通常需要的两到三年的开发周期。

为什么这种冲刺至关重要

OpenAI 现在运行模型所使用的硬件包括 Cerebras、AWS Trainium、AMD 等,而不再仅仅依赖 Nvidia GPU。随着 AI 工作负载从训练密集型转向推理密集型,功耗和单次查询成本变得至关重要。如果一款芯片能将万亿参数模型的能耗减半,那么对于每天处理数十亿次请求的服务来说,可以大幅降低运营成本。

AI 如何编写芯片设计

Jalapeño 是一款 ASIC——一种专为运行大语言模型(LLM)而设计的芯片。与通用 GPU 不同,ASIC 剥离了不必要的逻辑,并针对 LLM 推理模式定制了数据路径。OpenAI 的工程师使用 XLS 编写了设计,这是一种允许机器学习模型生成代码的硬件描述语言。该公司表示,AI 生成的逻辑占芯片核心部分的半数以上,将设计流程从数年缩短到了数月。

性能指标与现实

OpenAI 列出了 Jalapeño 的三个核心指标:

  • 每千瓦吞吐量:比 Nvidia GB200/GB300 高出 1.5 – 1.9 倍
  • 延迟:比同型号 Nvidia 模型低 1.7 – 3.6 倍
  • 万亿参数模型的功耗700 W,而 GB300 为 1,400 W

如果这些数据属实,数据中心可以在提供更快响应的同时,将电力成本降低一半。这些声明侧重于推理;OpenAI 并未提及训练性能,这与其目前专注于提供聊天类应用的重点相一致。

这对 Nvidia 意味着什么

Nvidia 即将推出的 Blackwell 和 Vera Rubin 芯片瞄准了高端加速器市场。Nvidia 的优势在于成熟的软件栈、广泛的开发者采用以及在各种 AI 任务中的灵活性。相比之下,Jalapeño 是一种用途单一的设备,只有在工作负载与其专业领域匹配时才能胜出。

Nvidia 面临的压力来自两个方面。首先,能够负担得起定制 ASIC 的客户可能会为了预期的成本节省而转向其他方案,从而蚕食 Nvidia 的推理市场份额。其次,AI 能够辅助硬件设计的证明可能会压缩竞争对手的开发周期,迫使 Nvidia 加快其路线图的进度。

反对观点与悬而未决的问题

  • 软件生态系统:对于大多数开发者而言,Nvidia 的 CUDA 库、性能分析工具和社区支持仍然具有决定性的优势。集成 Jalapeño 将需要新的工具链,甚至可能需要重写代码。
  • 实际应用验证:这些数据来自 OpenAI 的内部测试。独立的基准测试、长期可靠性数据以及在混合租户负载下的扩展行为仍有待验证。
  • 规模经济:ASIC 的成本优势随产量增加而增长。OpenAI 的内部使用可能证明了这项投资的合理性,但除非实现大规模生产,否则外部客户可能会面临更高的单芯片价格。

展望未来

目前,Jalapeño 证明了九个月的冲刺可以生产出一种在理论上于 AI 技术栈中最具成本敏感性的环节中超越现有 GPU 的芯片。真正的考验在于,这种优势能否在真实世界工作负载的严苛考验下得以维持。