Mambo Muhimu ya Benchmark

Kongamano la Hot Chips lilifichua takwimu ambazo kampuni huru ilithibitisha kwa kutumia mfululizo wa InferenceX. OpenAI inaiita Jalapeño kuwa accelerator wa inference wa jumla—inatumia modeli lakini haifundishi modeli hizo. Katika majaribio hayo, chip hiyo:

  • Ilitoa kazi nyingi zaidi kwa kiasi cha 1.5 × hadi 1.9 × kwa kila watt wakati wa uwezo wa juu zaidi kuliko viongozi wa leo.
  • Ilipunguza ucheleweshaji (latency) kwa 1.7 × hadi 3.6 ×, huku kukiwa na ongezeko la mwingiliano la 2.1 × hadi 4.1 ×.

Matokeo mahususi kwa modeli:

  • GPT-OSS 120B: ~tokeni 1,400 / sekunde / mtumiaji.
  • Deepseek R1 670B: ~tokeni 700 / sekunde kwenye ombi moja la wakati mmoja.
  • Kimi K2.5 1T: ilijaribiwa katika mfululizo wa utendaji wa juu (namba kamili hazikutolewa).

OpenAI ilisisitiza kuwa takwimu hizi zilipatikana bila kutumia speculative decoding au multi-token prediction—mbinu ambazo washindani wengi hutumia ili kuongeza namba za kichwa cha habari.

Jinsi Jalapeño Ilivyojengwa

OpenAI ilimaliza usanifu wa chip hiyo ndani ya miezi tisa, ikishirikiana na Broadcom. Kampuni hiyo ilitumia modeli zake yenyewe katika mzunguko wa usanifu, ikiharakisha uundaji wa ramani, uprogramu, na uboreshaji—mbinu inayojulikana kama “AI-assisted silicon design.” Harakati hiyo inasisitiza mabadiliko kutoka kwenye mizunguko ya miaka mingi ambayo wakati huo ilitawala utengenezaji wa silicon yenye utendaji wa juu.

Athari kwa Uongozi wa Nvidia

Nvidia inategemea utendaji wa hali ya juu na mfumo wa CUDA. Data mpya inafanya ushindani wa utendaji kuwa wa kushindana. Wachambuzi wanaonya kwamba ikiwa kampuni zaidi za AI zitatoa silicon ya inference iliyobinafsishwa yenye ufanisi kama huo, watengenezaji wanaweza kuacha kutumia CUDA, na kufungua nafasi kwa mifumo mbadala na soko lililogawanyika.

Mkakati wa Mawasiliano Mchanganyiko wa OpenAI

Afisa mkuu wa fedha Kelly Huang alielezea Jalapeño kama sehemu moja ya mpango mpana wa kompyuta, na si mbadala kamili wa washirika waliopo. OpenAI bado inafanya kazi na Nvidia, AMD, AWS, na Cerebras katika kazi mbalimbali. Jalapeño bado ni sampuli ya kihandisi; bado haijakabiliana na modeli kubwa zinazokuja kama Deepseek V4 Pro. Maoni ya Huang yanaashiria kuwa OpenAI itachanganya silicon yake yenyewe na accelerator za upande wa tatu, ikitafuta mchanganyiko bora wa gharama na utendaji kwa kila kazi.

Hoja za Upande wa Pili

Sampuli za hatua za awali hazihakikishii uzalishaji wa wingi, ufanisi wa uzalishaji (yields), au uaminifu wa muda mrefu, hivyo msisimko unapaswa kudhibitiwa.

Nini cha Kuangalia Kufuatia

  • Uzalishaji wa bidhaa: Je, OpenAI inaweza kuifanya Jalapeño kuwa sehemu inayozalishwa kwa wingi, na kwa bei gani?
  • Mifumo ya programu (Software stack): Je, mfumo wa uprogramu na zana (toolchain) utakuwa na ukomavu kiasi gani kwa watengenezaji?
  • Majibu ya washindani: Je, Nvidia na wauzaji wengine watarekebishaje ramani zao (roadmaps) au bei ili kulinda sehemu yao ya soko?
  • Upanuzi wa modeli: Je, Jalapeño itaendelea kuwa na ushindani katika wimbi lijalo la modeli zenye vigezo (parameters) trilioni?

Hitimisho: Silicon ya inference iliyobinafsishwa inahama kutoka kwenye jaribio la kipekee kuelekea kuwa changamoto ya kweli kwa utawala wa vifaa vya Nvidia.