Modele Qwen2.5-Max od Alibaby oraz V3-Flash od DeepSeek trafiły na rynek w tym tygodniu, wybierając różne ścieżki do tańszego wnioskowania (inference) AI. Alibaba aktywuje jedynie około 95 miliardów parametrów na zapytanie dzięki swojej architekturze mixture-of-experts (MoE) o rozmiarze 2,4 biliona parametrów; DeepSeek natomiast upraszcza architekturę, aby drastycznie obniżyć cenę za token. Wyścig zbrojeń w dziedzinie AI mierzy się teraz w dolarach za token, a nie tylko w wielkości modelu.
Od „Większej liczby parametrów” do „Niższych kosztów”
Przez lata główną metryką w rozwoju dużych modeli językowych (LLM) była liczba parametrów. OpenAI, Google i inni chwalili się przekraczaniem bariery biliona parametrów, zakładając, że większy oznacza mądrzejszy. Alibaba i DeepSeek pokazują, że te obliczenia uległy zmianie.
Qwen2.5-Max od Alibaby wciąż opiera się na skali, ale stosuje trik pozwalający na oszczędność kosztów. W modelu gęstym (dense model) każdy parametr pracuje przy każdym wnioskowaniu, co zmienia sieć o 2,4 biliona parametrów w pożerającą energię bestię. MoE dzieli sieć na wielu „ekspertów” i kieruje każde zapytanie do podzbioru. Router w Qwen2.5-Max wybiera około 95 miliardów parametrów dla dowolnego promptu, zapewniając moc rozumowania systemu o bilionie parametrów przy jednoczesnym zachowaniu kontroli nad opóźnieniami i zużyciem energii.
DeepSeek całkowicie rezygnuje z ambicji posiadania biliona parametrów. Jego model V3-Flash został zbudowany tak, aby działać tanio, szybko i na dużą skalę. Firma promuje model w oparciu o „ultra-niskie ceny wnioskowania”, celując w deweloperów, którzy przetwarzają miliony tokenów dziennie bez nadwyrężania budżetu. Dokładna cena nie została ujawniona, ale przekaz jest jasny: jeśli startup nie może pozwolić sobie na zachodnie stawki za token, V3-Flash staje się realną alternatywą.
Dlaczego koszt wnioskowania staje się przewagą konkurencyjną
Koszt wnioskowania ma znaczenie, gdy modele opuszczają laboratorium i trafiają do produkcji. Przedsiębiorstwa wdrażające LLM w chatbotach, procesach analizy dokumentów czy silnikach rekomendacyjnych szybko zauważają, że ceny na poziomie tokenów dominują w wydatkach operacyjnych. Model, który kosztuje połowę mniej za token, może podwoić budżet na inne inicjatywy – więcej danych, większy ruch lub dodatkowe funkcje.
Obie chińskie firmy celują w inne segmenty rynku. MoE od Alibaby obiecuje wysoką wydajność w złożonych zadaniach wymagających rozumowania, przy jednoczesnym zachowaniu umiarkowanego budżetu obliczeniowego na zapytanie. Z kolei bardziej smukły model DeepSeek przyciąga obciążenia o dużej objętości i niskich wymaganiach co do opóźnień, gdzie surowa moc obliczeniowa jest mniej istotna niż przewidywalny koszt.
Obie strategie mogą podgryzać zachodnich dostawców, którzy łączą duże modele z wysokimi cenami premium. Jeśli deweloperzy osiągną porównywalne wyniki przy niższej cenie za token, motywacja do korzystania z drogich API słabnie.
Stawka dla globalnego ekosystemu AI
- Startupy i MŚP: Niższe koszty wnioskowania obniżają barierę wejścia dla produktów opartych na AI. Zespoły, które niegdyś potrzebowały dodatkowego kapitału na rachunki za API, mogą teraz tworzyć prototypy i wprowadzać produkty na rynek przy znacznie skromniejszych budżetach.
- Przedsiębiorstwa: Duże korporacje prowadzące wewnętrzne usługi AI mogą ograniczyć wydatki operacyjne, uwalniając środki na pozyskiwanie danych, dotrenowywanie (fine-tuning) modeli lub dodatkową moc obliczeniową.
- Zachodni dostawcy: Ich modele przychodowe opierają się na opłatach za token. Przejście w stronę alternatyw skoncentrowanych na kosztach zmusza ich do obniżania cen lub różnicowania się poprzez możliwości, których tańsze modele nie potrafią jeszcze dorównać.
- Regulatorzy i decydenci: Bardziej przystępna cenowo sztuczna inteligencja może przyspieszyć adopcję w różnych sektorach, co rodzi pytania o nadzór, prywatność danych i tempo automatyzacji.
Kompromisy i kontrargumenty
Modele MoE, takie jak Qwen2.5-Max, nie są rozwiązaniem idealnym. Logika routingu dodaje złożoności inżynieryjnej, a rzadka aktywacja (sparse activation) może powodować nierówną wydajność w zależności od typu zapytania. Jeśli router popełni błąd, zapytanie może trafić do suboptymalnych ekspertów, co obniży jakość odpowiedzi. Co więcej, sprzęt wciąż faworyzuje gęste obliczenia; wyspecjalizowane akceleratory dla wnioskowania MoE nie są jeszcze powszechne, co może ograniczać rzeczywiste zyski w wydajności.
Filozofia DeepSeek, stawiająca koszty na pierwszym miejscu, również niesie ze sobą ryzyka. Agresywne ceny często oznaczają ściślejsze ograniczenia rozmiaru modelu i danych treningowych, co może ograniczać jego wydajność. W przypadku aplikacji wymagających niuansowego rozumowania, tańszy model może okazać się niewystarczający, co skłoni użytkowników z powrotem ku większym i droższym alternatywom.
W końcu „inteligencja na dolara” to tylko jedna z osi konkurencji. Opóźnienia, niezawodność, wsparcie ekosystemu i zgodność z regionalnymi przepisami pozostają decydujące. Firmy, które zaoferują zrównoważony pakiet we wszystkich tych wymiarach, prawdopodobnie zdominują rynek, a nie tylko te, które wygrają wojnę cenową.
Co warto obserwować dalej
- Publikacje wyników benchmarków: Niezależne ewaluacje wydajności routingu MoE w Qwen2.5-Max oraz kosztu tokenów w V3-Flash wykażą, czy szum medialny przekłada się na wymierne oszczędności.
- Rozwój sprzętu: Wdrożenie akceleratorów zoptymalizowanych pod kątem rzadkiej aktywacji (sparse activation) może wzmocnić korzyści płynące z MoE, podczas gdy uniwersalne procesory GPU mogą utrzymać konkurencyjność modeli gęstych (dense models).
- Reakcje cenowe: Zachodni dostawcy mogą dostosować swoje plany taryfowe lub wprowadzić funkcje pozwalające na oszczędności, takie jak zniżki na wnioskowanie wsadowe (batch inference) czy licencjonowanie on-premise.
- Działania regulacyjne: Wraz z upowszechnianiem się tańszej sztucznej inteligencji, rządy mogą wprowadzić standardy przejrzystości i bezpieczeństwa, które mogą wpłynąć na sposób wdrażania tych modeli na dużą skalę.
Wnioski
Oparty na MoE model Qwen2.5-Max od Alibaby oraz tani V3-Flash od DeepSeek pokazują, że wyścig w dziedzinie AI toczy się teraz w takim samym stopniu w arkuszach kalkulacyjnych budżetów, co w liczbie parametrów. Firmy, które dostarczą zaawansowane zdolności językowe przy jednoczesnym zachowaniu niskich kosztów za token, otworzą AI na szerszą grupę użytkowników, przekształcając dynamikę konkurencji, która od dawna sprzyjała największym i najdroższym modelom.
