Czerwcowy raport Vercel dotyczący udziału w tokenach pokazuje, że modele z otwartymi wagami obsługują 29% tokenów bramy (gateway), co stanowi wzrost z 11% w kwietniu, przy czym sam DeepSeek odpowiada za 22,6% tego wolumenu. Ten skok sygnalizuje gwałtowną zmianę: programiści odchodzą od jednego „najlepszego” modelu i zaczynają traktować modele AI jako infrastrukturę podlegającą routowaniu.
Dlaczego programiści traktują modele jako infrastrukturę
Tanie modele z otwartymi wagami — wiele z nich pochodzi od chińskich dostawców — kosztują ułamek tego, co oferty premium, takie jak Anthropic. W przypadku rutynowych zadań, takich jak ekstrakcja kodu, czyszczenie tekstu czy proste wyszukiwanie danych, model kosztujący centy, a nie dolary, może być bardziej atrakcyjny, nawet jeśli jest o kilka procent mniej dokładny.
Rezultatem jest nowy wzorzec projektowy. Aplikacja najpierw wysyła zapytanie do taniego modelu w celu wykonania „nudnej” części pracy. Jeśli wynik przejdzie prostą kontrolę jakości, proces trwa dalej; jeśli nie, wywoływany jest droższy model w celu ponownego sprawdzenia lub podjęcia ostatecznej decyzji. To logika routingu staje się kluczowym elementem, a nie wybór pojedynczego modelu.
Co mówią liczby
Dane Vercel, pochodzące z jego bramy obsługującej wielu dostawców AI, pokazują, że modele z otwartymi wagami przenoszą się z peryferii do głównego nurtu. W kwietniu stanowiły nieco ponad jedną dziesiątą wszystkich tokenów; do czerwca zbliżyły się do jednej trzeciej. Sam DeepSeek, chiński model, przyczynił się do ponad jednej piątej wolumenu tokenów.
Modele klasy premium wciąż dominują pod względem wydatków. Anthropic, na przykład, nadal pochłania większość nakładów pieniężnych, ponieważ jego cena za token jest wyższa. Matematyka jest prosta: tanie modele wygrywają w pracy o dużej objętości i niskiej marży, podczas gdy drogie modele zachowują zadania o wysokiej marży i dużym znaczeniu.
Implikacje dla agentów AI
Agent AI zazwyczaj wykonuje sekwencję kroków: planowanie, pobieranie danych, wywoływanie narzędzi i doprecyzowanie wyników. Gdy każdy krok może zostać przypisany do najbardziej opłacalnego modelu, ogólny koszt operacyjny drastycznie spada.
- Pobieranie i ekstrakcja danych często wymagają jedynie podstawowego rozumienia języka, w czym tanie modele radzą sobie doskonale.
- Ostateczna ocena — część decydująca o tym, czy odpowiedź jest akceptowalna — pozostaje domeną modeli premium o wyższej niezawodności.
To warstwowe podejście pozwala programistom automatyzować większe obciążenia bez przekraczania budżetów. Wymusza to również zmianę podejścia z „wybierz najlepszy model” na „mierzy sukces na każdym kroku i odpowiednio kieruj zapytania”.
Ryzyka i ograniczenia
Ekonomia jest przekonująca, ale przejście nie jest pozbawione tarć.
- Zgodność (Compliance): Niektóre jurysdykcje nakładają surowe zasady przetwarzania danych, co może ograniczać stosowanie modeli hostowanych za granicą.
- Złożoność hostingu: Duże modele premium są trudne do uruchomienia we własnym zakresie, więc organizacje muszą polegać na zewnętrznych API, co może zwiększać opóźnienia i budzić obawy o uzależnienie od dostawcy (vendor lock-in).
Ze względu na te czynniki mało prawdopodobne jest, aby tanie modele całkowicie zastąpiły te premium. Zamiast tego stają się domyślnym wyborem do rutynowej pracy, podczas gdy modele premium pozostają w „warstwie decyzyjnej”, gdzie ich wyższy koszt jest uzasadniony.
Na co warto zwrócić uwagę w przyszłości
- Narzędzia do routingu: W miarę jak warstwa routingu staje się coraz bardziej centralna, możemy spodziewać się fali SDK i platform automatyzujących wybór modelu na podstawie opóźnień, kosztów i progów pewności.
Programiści, którzy zaczną mierzyć sukces na poziomie zadań, śledzić ponowienia (retries) i wyraźnie oddzielać „objętość” od „oceny”, będą najlepiej przygotowani, aby czerpać korzyści z rodzącego się podejścia opartego na infrastrukturze.
Podsumowanie: Stos AI ewoluuje z wyboru pojedynczego modelu w problem routingu, gdzie tanie modele z otwartymi wagami obsługują większość pracy, a modele premium są zarezerwowane dla decyzji o dużym znaczeniu. Opanowanie tego routingu będzie kolejną przewagą konkurencyjną dla twórców AI.
