Uruchamianie dużych modeli AI na dużą skalę stało się mniej wyczynem naukowym, a bardziej brutalnym problemem matematycznym dotyczącym rachunków za prąd i wynajmu centrów danych. Każdy token generowany przez Gemini kosztuje Google realne zasoby – cykle krzemowe, przepustowość pamięci i waty pobierane z sieci. Wraz ze wzrostem liczby zapytań, ułamki centów sumują się do kwot, które mogą całkowicie pochłonąć marże. Za tą cichą pilnością stoi Frozen v2 – wewnętrzny projekt chipu serwerowego, który nabiera kształtów w Google. Zamiast ulepszać swoje jednostki Tensor Processing Units (TPU) ogólnego przeznaczenia przez kolejną generację, firma próbuje czegoś znacznie bardziej radykalnego: odlania szkieletu modelu Gemini bezpośrednio w samym krzemie.

Od elastycznych akceleratorów do krzemu dedykowanego modelom

Jednostki TPU od Google są koni roboczymi jej infrastruktury od niemal dekady. Trenują modele, napędzają algorytmy rankingu wyszukiwania, a nawet są wynajmowane na godziny klientom chmurowym, w tym firmie Meta oraz innym podmiotom szukającym alternatywy dla procesorów graficznych Nvidia. Ta wszechstronność jest dokładnie tym, co czyni TPU jednostką TPU. Operuje ona ogólnym zestawem operacji mnożenia macierzy i przemieszczania danych w pamięci, które może wykorzystać niemal każda sieć neuronowa opisana w oprogramowaniu.

Frozen v2 celowo rezygnuje z tej elastyczności. Chip jest projektowany jako akcelerator dedykowany konkretnej dziedzinie (domain-specific), którego obwody fizycznie odzwierciedlają fragmenty architektury samego Gemini. Tam, gdzie TPU pobiera instrukcje i interpretuje je jako operacje programowe, Frozen v2 „wypalałby” strukturalny schemat modelu – układ jego warstw i ścieżek danych – bezpośrednio w układzie chipu. Google spodziewa się, że to ścisłe połączenie modelu z metalem sprawi, że chip będzie sześć do dziesięciu razy bardziej wydajny niż obecne jednostki TPU w obsłudze odpowiedzi AI. Mniejsza liczba kroków obliczeniowych na zapytanie oznacza krótszy czas oczekiwania na pojawienie się tokena i znacznie mniejsze zużycie energii podczas jego generowania.

To nie jest po prostu szybsza wersja tego samego pomysłu. To inna kategoria chipu – taka, która poświęca uniwersalność na rzecz oddania jednej rodzinie modeli.

Dlaczego pierwszy „Frozen” stopniał

Podejście to ma korzenie w wcześniejszej koncepcji przypisywanej Jeffowi Deanowi, Chief Scientist w Google DeepMind. Pierwotna propozycja „Frozen” zakładała jeszcze większą specjalizację poprzez wpisanie na sztywno (hardcoding) nie tylko architektury, ale i samych wag modelu – miliardów dostrojonych parametrów stanowiących wyuczone zachowanie Gemini – bezpośrednio w samym chipie.

Logika była słuszna. Jeśli dokładnie wiesz, jakich liczb użyje model, po co zawracać sobie głowę pobieraniem ich z pamięci zewnętrznej? Można by je wyryć w tranzystorach i wyeliminować całe kategorie opóźnień.

Problemem była trwałość. Modele AI nie stoją w miejscu. Google stale aktualizuje Gemini, dotrenowując je na nowych danych, dostosowując parametry i wydając ulepszone wersje. Chip z wagami zamrożonymi w krzemie stałby się bezużytecznym przyciskiem do papieru w momencie wydania nowej rewizji modelu. Ten brak elastyczności zabił pierwotną koncepcję.

Architektura bez kotwicy

Frozen v2 rozwiązuje problem pułapki przestarzałości poprzez wpisanie na sztywno architektury przy jednoczesnym pozostawieniu wag wolnych do zmian. Można to porównać do wylania dedykowanego toru wyścigowego zamiast spawania samochodu do drogi. Kształt obwodu pozostaje stały, zoptymalizowany pod konkretne wzorce obliczeniowe Gemini, ale dane przepływające przez te obwody mogą być odświeżane poprzez wczytywanie nowych wag z pamięci.

Ta różnica ma znaczenie w praktyce. Gdy inżynierowie trenują nowy checkpoint Gemini, mogą go wdrożyć na sprzęcie Frozen v2 bez konieczności produkcji nowego chipu. Dokładny stopień utwardzenia (hardcodingu) pozostaje w Google otwartym pytaniem; zespoły muszą zdecydować, które elementy strukturalne zasługują na krzemową nieśmiertelność, a które powinny pozostać konfigurowalne. Jednak zasada jest ustalona. Zamrażając kształt i płynnie wymieniając parametry, Google zachowuje korzyści płynące z wydajności, nie poświęcając przy tym zdolności do iteracji.

Ekonomia trzymania technologii wewnątrz firmy

Istnieje jeszcze jeden powód, dla którego nie znajdziecie Frozen v2 w cenniku Google Cloud. Ponieważ chip jest tak ściśle dopasowany do wewnętrznej budowy Gemini, miałby on niewiele sensu dla zewnętrznych programistów korzystających z PyTorch lub niestandardowych wariantów Transformer. Google nie planuje sprzedawać go jako produktu ogólnego przeznaczenia. Pozostanie on narzędziem wewnętrznym, skierowanym bezpośrednio na zaspokojenie ogromnego zapotrzebowania na moc obliczeniową wnioskowania (inference) w centrach danych Google.

Ten wybór odzwierciedla brutalną rzeczywistość ekonomiczną. Na obecnym rynku generatywnej sztucznej inteligencji możliwości modeli szybko się zbiegają. Różnica między konkurentami często sprowadza się do tego, kto może pozwolić sobie na uruchomienie największego modelu przy najniższym koszcie za token. Wnioskowanie nie jest już tylko kwestią wtórną wobec trenowania; w przypadku tak powszechnie używanego produktu jak Gemini, stanowi ono dominujący koszt. Jeśli Frozen v2 obniży ten koszt sześciokrotnie lub bardziej, Google zyska pole manewru, którego konkurenci nie będą mogli łatwo dorównać. Może albo zatrzymać oszczędności jako marżę, albo przekazać je w postaci niższych cen dla użytkowników API i integracji produktowych, dociskając śrubę OpenAI, Anthropic i innym.

Co to oznacza dla branży

Ruch Google sugeruje również, w jakim kierunku zmierza szersza strategia sprzętowa. Przez lata standardowym podejściem było budowanie jak najbardziej elastycznego akceleratora i pozostawienie specjalizacji oprogramowaniu. Procesory GPU firmy Nvidia dominują, ponieważ obsługują wszystko – od dynamiki molekularnej, przez gry wideo, aż po duże modele językowe. Własne układy TPU Google zostały zaprojektowane w tym samym duchu szerokiej użyteczności.

Frozen v2 przełamuje tę tradycję. Jest to przyznanie, że gdy jedna rodzina modeli generuje wystarczającą liczbę zapytań, dedykowany krzem dostosowany do tego modelu może zwrócić się wielokrotnie. Inni hyperscalers stosowali podobną logikę – na przykład chipy Trainium i Inferentia od Amazon – ale podejście Google idzie głębiej, projektując sprzęt wspólnie z konkretną architekturą modelu, a nie z ogólną klasą sieci.

Ryzykiem jest oczywiście sztywność. Jeśli architektura Gemini ewoluuje w kierunku, którego nie będą w stanie obsłużyć sztywno zaprogramowane obwody, Google może zostać z drogim krzemem, który nie będzie w stanie obsłużyć jego najnowszych pomysłów. Właśnie dlatego kompromis oparty wyłącznie na architekturze ma znaczenie. Oferuje on drogę środka: wystarczającą specjalizację, aby osiągnąć spektakularne zyski w wydajności, oraz wystarczającą elastyczność, aby nie zapędzić firmy w kozi róg.

Kluczowy wniosek

Frozen v2 najlepiej rozumieć nie jako ogłoszenie nowego chipu, lecz jako strategiczny zakład o przyszły kształt konkurencji w dziedzinie AI. Google zakłada, że zwycięzcy nie będą jedynie budować najlepszych modeli, ale będą kontrolować cały stos technologiczny – od projektu modelu aż po elektrony przepływające przez tranzystor. Jeśli projekt odniesie sukces, zysk nie będzie widoczny w wynikach benchmarków. Objawi się on w kolumnie kosztów w kwartalnym raporcie finansowym, gdzie zaoszczędzenie kilku centów na milionie tokenów może wyznaczyć na nowo granice tego, co jest komercyjnie możliwe w generatywnej sztucznej inteligencji.