OpenAI zaprezentowało własny chip do wnioskowania, Jalapeño, i twierdzi, że zapewnia on do 1,9 × większą przepustowość na kilowat niż akceleratory Nvidia GB200 i GB300. Zespół przekształcił koncepcję w działającą matrycę krzemową w zaledwie dziewięć miesięcy — znacznie szybciej niż standardowy, dwu- lub trzyletni cykl tworzenia dedykowanych procesorów AI.

Dlaczego ten sprint ma znaczenie

OpenAI uruchamia obecnie modele na sprzęcie od Cerebras, AWS Trainium, AMD i innych, zamiast polegać wyłącznie na procesorach graficznych Nvidia. W miarę jak obciążenia AI przesuwają się z trenowania na wnioskowanie, kluczowe stają się zużycie energii oraz koszt pojedynczego zapytania. Chip, który zmniejsza o połowę zapotrzebowanie na energię w przypadku modelu o bilionie parametrów, mógłby znacząco obniżyć koszty operacyjne usług obsługujących miliardy żądań każdego dnia.

Jak AI napisało ten chip

Jalapeño to ASIC — chip zbudowany w jednym celu: do obsługi dużych modeli językowych (LLM). W przeciwieństwie do procesorów GPU ogólnego przeznaczenia, ASIC eliminuje zbędną logikę i dostosowuje ścieżki danych do wzorców wnioskowania LLM. Inżynierowie OpenAI napisali projekt w języku XLS — języku opisu sprzętu, który pozwala modelom uczenia maszynowego na generowanie kodu. Firma twierdzi, że logika wygenerowana przez AI stanowi ponad połowę rdzenia chipa, co skróciło proces projektowy z lat do miesięcy.

Obietnice wydajności a rzeczywistość

OpenAI podaje trzy kluczowe liczby dla Jalapeño:

  • Przepustowość na kilowat: o 1,5 – 1,9 × wyższa niż w przypadku Nvidia GB200/GB300.
  • Opóźnienie: o 1,7 – 3,6 × niższe niż w tych samych modelach Nvidia.
  • Pobór mocy przy modelu o bilionie parametrów: 700 W w porównaniu do 1 400 W w GB300.

Jeśli te dane się potwierdzą, centrum danych mogłoby uruchamiać ten sam model przy połowę niższych kosztach energii, zapewniając jednocześnie szybsze odpowiedzi. Obietnice dotyczą wnioskowania; OpenAI nie odnosi się do wydajności w trenowaniu, co wpisuje się w obecny nacisk firmy na obsługę aplikacji typu chat.

Co to oznacza dla Nvidii

Nadchodzące chipy Blackwell i Vera Rubin od Nvidii celują w rynek wysokiej klasy akceleratorów. Przewaga Nvidii tkwi w dojrzałym stosie oprogramowania, szerokim zastosowaniu wśród programistów oraz elastyczności w różnych zadaniach AI. Jalapeño, przeciwnie, jest urządzeniem o wąskim przeznaczeniu, które wygrywa tylko wtedy, gdy obciążenie odpowiada jego specjalizacji.

Presja na Nvidię ma dwa aspekty. Po pierwsze, klienci, których stać na własny układ ASIC, mogą przejść na niego w poszukiwaniu obiecanych oszczędności, podgryzając udział Nvidii w rynku wnioskowania. Po drugie, dowód na to, że AI może pomagać w projektowaniu sprzętu, może skrócić cykle rozwojowe konkurencji, zmuszając Nvidię do przyspieszenia realizacji jej planów rozwoju.

Kontrargumenty i otwarte pytania

  • Ekosystem oprogramowania: biblioteki CUDA od Nvidii, narzędzia profilujące i wsparcie społeczności wciąż dają jej decydującą przewagę dla większości programistów. Integracja Jalapeño będzie wymagała nowych zestawów narzędzi, a być może nawet przepisania kodu.
  • Walidacja w rzeczywistych warunkach: liczby pochodzą z wewnętrznych testów OpenAI. Niezależne benchmarki, dane dotyczące długoterminowej niezawodności oraz zachowanie przy skalowaniu pod obciążeniami typu mixed-tenant pozostają niezweryfikowane.
  • Ekonomia skali: przewaga kosztowa układu ASIC rośnie wraz z wolumenem produkcji. Wewnętrzne zastosowanie przez OpenAI może uzasadniać inwestycję, ale zewnętrzni klienci mogą mierzyć się z wyższymi cenami za pojedynczy chip, chyba że produkcja zostanie przeskalowana.

Spojrzenie w przyszłość

Na razie Jalapeño udowadnia, że dziewięciomiesięczny sprint może zaowocować chipem, który na papierze przewyższa obecne procesory GPU w najbardziej wrażliwym na koszty segmencie stosu AI. Prawdziwym testem będzie to, czy ta przewaga przetrwa próbę rzeczywistych obciążeń roboczych.