DeepMind zaprezentowało w tym tygodniu DiffusionGemma, otwarty model językowy (open-weight), który potrafi generować około 1500 tokenów na sekundę na pojedynczym GPU H100, podczas gdy standardowy model Gemma 4 osiąga maksymalnie około 303 tokeny na sekundę. Ten wzrost prędkości jest istotny, ponieważ może zredukować wąskie gardło opóźnień, które spowalnia agentów napędzanych przez AI w aplikacjach czasu rzeczywistego.
Jak DiffusionGemma przełamuje nawyk generowania token po tokenie
Większość nowoczesnych modeli językowych generuje tekst autoregresyjnie: przewidują jeden token, podają go z powrotem do modelu, a następnie przewidują kolejny. Ta pętla „od lewej do prawej” wymusza ścisłe powiązanie między mocą obliczeniową a pamięcią, ponieważ wagi modelu muszą być odczytywane dla każdego pojedynczego tokena. DiffusionGemma zastępuje tę pętlę procesem dyfuzji dyskretnej, który traktuje fragment 256 tokenów jako pojedynczy blok zaszumionych danych. Model następnie odszumia cały blok równolegle, przenosząc obciążenie z powtarzalnych odczytów wag na większą ilość obliczeń w każdym kroku. Na sprzęcie, który doskonale radzi sobie z obliczeniami równoległymi, takim jak Nvidia H100, ten kompromis przynosi korzyści.
Dlaczego prędkość ma znaczenie dla agentów AI
Autonomiczni agenci zazwyczaj pracują w cyklu przeszukiwania, podsumowywania i testowania. Każdy krok może wymagać kilku wywołań modelu, więc każde opóźnienie na token szybko się kumuluje. Gdy model się zacina, cały potok agenta zostaje zablokowany, co zwiększa koszty i pogarsza doświadczenia użytkownika.
Kompromis wydajnościowy
Prędkość DiffusionGemma wiąże się z mierzalnym kosztem w surowych zdolnościach modelu. W benchmarku AIME — zestawie mierzącym rozumowanie, faktyczność i rozumienie języka — DiffusionGemma uzyskuje wynik 69,1, podczas gdy Gemma 4 osiąga 88,3. Podejście dyfuzyjne wykazuje również słabości przy bardzo krótkich wynikach oraz sporadyczne „jąkanie się” tokenów, gdzie generowany tekst się powtarza lub waha. Gdy więcej niż około 32 użytkowników odpytuje model jednocześnie, przewaga równoległości zanika, a standardowa metoda autoregresyjna dogania ją pod względem całkowitej przepustowości.
Zastosowanie poszczególnych podejść
Dane sugerują hybrydową strategię wdrażania:
- Modele dyfuzyjne dla zadań o niskiej współbieżności i niskiej tolerancji na opóźnienia, które nie wymagają głębokiego rozumowania — np. generowanie krótkich promptów, wypełnianie szablonów lub tworzenie szkiców tekstów.
- Modele autoregresyjne dla obciążeń o wysokiej współbieżności, złożonego rozumowania lub generowania długich form, gdzie dokładność przeważa nad czystą prędkością.
Co ta zmiana oznacza dla infrastruktury AI
Jeśli zyski prędkości można osiągnąć poprzez zmianę algorytmu generowania, a nie tylko poprzez zwiększanie rozmiaru modelu, największe korzyści z wydajności mogą płynąć z ulepszeń w warstwie przesyłowej (tzw. „plumbing”). Kompromis ten oznacza również, że programiści muszą zaakceptować niewielki spadek jakości w niektórych przypadkach użycia.
Kontrargument: czy dyfuzja jest gotowa na szerokie zastosowanie?
Implementacja dyfuzji ma trudności z krótkimi promptami i może generować niestabilne wyniki.
Na co warto zwrócić uwagę
- Badania nad skalowaniem: Czy większe modele dyfuzyjne zniwelują lukę w zdolnościach, zachowując jednocześnie prędkość?
- Optymalizacje sprzętowe: W miarę ewolucji procesorów GPU, równowaga między etapami dyfuzji wymagającymi dużej mocy obliczeniowej a autoregresją wymagającą dużej ilości wag może ulec ponownemu przesunięciu.
- Algorytmy routingu: Wczesne prototypy routerów modeli świadomych zadań ujawnią, jak bardzo można skrócić całkowite opóźnienie systemu dzięki dynamicznemu wyborowi.
Podsumowanie
DiffusionGemma udowadnia, że ponowne przemyślenie fundamentalnej pętli generowania może drastycznie zmniejszyć opóźnienia bez konieczności dodawania kolejnych chipów. Technologia ta nie jest całkowitym zastępstwem dla modeli autoregresyjnych, ale stanowi przekonujące narzędzie dla hybrydowego stosu AI, w którym prędkość i dokładność są balansowane w zależności od zadania. Następna fala infrastruktury AI będzie prawdopodobnie oceniana nie tylko po rozmiarze modelu, ale po tym, jak sprytnie kieruje ona zadaniami przez odpowiedni rodzaj silnika.
