Основные результаты бенчмарков

На конференции Hot Chips были представлены данные, которые независимая фирма подтвердила с помощью пакета InferenceX. OpenAI называет Jalapeño универсальным ускорителем инференса — он запускает модели, но не обучает их. В ходе тестов чип:

  • Обеспечил в 1,5–1,9 раза больше работы на ватт при пиковой пропускной способности, чем нынешние лидеры рынка.
  • Снизил задержку в 1,7–3,6 раза, а прирост в интерактивных задачах составил от 2,1 до 4,1 раза.

Результаты для конкретных моделей:

  • GPT-OSS 120B: ~1400 токенов/сек/пользователь.
  • Deepseek R1 670B: ~700 токенов/сек при одном одновременном запросе.
  • Kimi K2.5 1T: протестирована в высокопроизводительном пакете (точные данные не разглашаются).

OpenAI подчеркнула, что эти показатели были достигнуты без использования спекулятивного декодирования или многотокеного предсказания — приемов, которые многие конкуренты используют для завышения громких цифр в заголовках.

Как создавался Jalapeño

OpenAI завершила проектирование чипа за девять месяцев в сотрудничестве с Broadcom. Компания использовала собственные модели в цикле проектирования, что ускорило создание чертежей, программирование и оптимизацию — этот метод получил название «проектирование чипов с помощью ИИ». Такой стремительный темп знаменует переход от многолетних циклов, которые раньше были нормой для разработки высокопроизводительных полупроводников.

Последствия для лидерства Nvidia

Nvidia опирается на чистую производительность и экосистему CUDA. Новые данные ставят под сомнение это преимущество. Аналитики предупреждают: если больше ИИ-компаний начнут внедрять собственные чипы для инференса с аналогичной эффективностью, разработчики могут начать отказываться от CUDA, что откроет путь альтернативным стекам технологий и приведет к фрагментации рынка.

Гибридная стратегия OpenAI

Финансовый директор Келли Хуанг представила Jalapeño как одну из составляющих более масштабного плана по вычислениям, а не как полную замену существующим партнерам. OpenAI по-прежнему работает с Nvidia, AMD, AWS и Cerebras для различных рабочих нагрузок. Jalapeño пока остается инженерным образцом; ему еще предстоит столкнуться с крупнейшими грядущими моделями, такими как Deepseek V4 Pro. Комментарии Хуанг позволяют предположить, что OpenAI будет сочетать собственные чипы со сторонними ускорителями, стремясь найти оптимальное соотношение цены и производительности для каждой задачи.

Контраргументы

Образцы на ранних стадиях не гарантируют объемов массового производства, высокого выхода годных кристаллов или долгосрочной надежности, поэтому к энтузиазму стоит относиться сдержанно.

На что обратить внимание в дальнейшем

  • Запуск производства: сможет ли OpenAI превратить Jalapeño в продукт массового производства и по какой цене?
  • Программный стек: насколько зрелыми будут модель программирования и инструментарий для разработчиков?
  • Реакция конкурентов: как Nvidia и другие вендоры скорректируют свои дорожные карты или ценообразование, чтобы защитить долю рынка?
  • Масштабирование моделей: сохранит ли Jalapeño свое преимущество перед следующей волной моделей с триллионами параметров?

Итог: Специализированные чипы для инференса переходят из разряда нишевых экспериментов в статус серьезного вызова доминированию Nvidia на рынке оборудования.