Основные результаты бенчмарков
На конференции Hot Chips были представлены данные, которые независимая фирма подтвердила с помощью пакета InferenceX. OpenAI называет Jalapeño универсальным ускорителем инференса — он запускает модели, но не обучает их. В ходе тестов чип:
- Обеспечил в 1,5–1,9 раза больше работы на ватт при пиковой пропускной способности, чем нынешние лидеры рынка.
- Снизил задержку в 1,7–3,6 раза, а прирост в интерактивных задачах составил от 2,1 до 4,1 раза.
Результаты для конкретных моделей:
- GPT-OSS 120B: ~1400 токенов/сек/пользователь.
- Deepseek R1 670B: ~700 токенов/сек при одном одновременном запросе.
- Kimi K2.5 1T: протестирована в высокопроизводительном пакете (точные данные не разглашаются).
OpenAI подчеркнула, что эти показатели были достигнуты без использования спекулятивного декодирования или многотокеного предсказания — приемов, которые многие конкуренты используют для завышения громких цифр в заголовках.
Как создавался Jalapeño
OpenAI завершила проектирование чипа за девять месяцев в сотрудничестве с Broadcom. Компания использовала собственные модели в цикле проектирования, что ускорило создание чертежей, программирование и оптимизацию — этот метод получил название «проектирование чипов с помощью ИИ». Такой стремительный темп знаменует переход от многолетних циклов, которые раньше были нормой для разработки высокопроизводительных полупроводников.
Последствия для лидерства Nvidia
Nvidia опирается на чистую производительность и экосистему CUDA. Новые данные ставят под сомнение это преимущество. Аналитики предупреждают: если больше ИИ-компаний начнут внедрять собственные чипы для инференса с аналогичной эффективностью, разработчики могут начать отказываться от CUDA, что откроет путь альтернативным стекам технологий и приведет к фрагментации рынка.
Гибридная стратегия OpenAI
Финансовый директор Келли Хуанг представила Jalapeño как одну из составляющих более масштабного плана по вычислениям, а не как полную замену существующим партнерам. OpenAI по-прежнему работает с Nvidia, AMD, AWS и Cerebras для различных рабочих нагрузок. Jalapeño пока остается инженерным образцом; ему еще предстоит столкнуться с крупнейшими грядущими моделями, такими как Deepseek V4 Pro. Комментарии Хуанг позволяют предположить, что OpenAI будет сочетать собственные чипы со сторонними ускорителями, стремясь найти оптимальное соотношение цены и производительности для каждой задачи.
Контраргументы
Образцы на ранних стадиях не гарантируют объемов массового производства, высокого выхода годных кристаллов или долгосрочной надежности, поэтому к энтузиазму стоит относиться сдержанно.
На что обратить внимание в дальнейшем
- Запуск производства: сможет ли OpenAI превратить Jalapeño в продукт массового производства и по какой цене?
- Программный стек: насколько зрелыми будут модель программирования и инструментарий для разработчиков?
- Реакция конкурентов: как Nvidia и другие вендоры скорректируют свои дорожные карты или ценообразование, чтобы защитить долю рынка?
- Масштабирование моделей: сохранит ли Jalapeño свое преимущество перед следующей волной моделей с триллионами параметров?
Итог: Специализированные чипы для инференса переходят из разряда нишевых экспериментов в статус серьезного вызова доминированию Nvidia на рынке оборудования.
