Jeśli uruchamiasz obciążenia produkcyjne na dużych modelach językowych, wiesz już, że wydajność modelu to tylko połowa sukcesu. Druga połowa to rachunek na koniec miesiąca. Trzej dostawcy — Mancer 2, Novita i StreamLake — niedawno skorygowali ceny swoich modeli. Jeśli korzystasz z któregokolwiek z tych API, Twoja kolejna faktura może wyglądać inaczej niż poprzednia.

Nie jest to już nic nadzwyczajnego. Rynek LLM wciąż eksperymentuje z tym, jak rozliczać wnioskowanie (inference). Niektórzy dostawcy rozliczają się za tysiąc tokenów. Inni grupują zapytania w poziomy (tiers) lub oferują zniżki za ciągłe użytkowanie. Gdy jedna platforma zmienia cenę jednostkową lub restrukturyzuje swoje poziomy, wpływ na budżet może wahać się od drobnej niedogodności po poważne przekroczenie kosztów. Śledzenie tych aktualizacji nie jest opcjonalne. To część pracy.

Dlaczego ceny API zasługują na Twoją uwagę

Deweloperzy często traktują ceny API jako pozycję typu „ustaw i zapomnij”. Przeprowadzasz benchmark modelu, wybierasz dostawcę i przechodzisz do budowania funkcji. To działa, dopóki nie przestanie. W obecnym krajobrazie zmiany cen mogą następować bez większego rozgłosu. Dostawca może obniżyć koszt starszego modelu, jednocześnie podnosząc cenę swojego nowszego endpointu. Inny może wprowadzić dopłaty za tokeny wyjściowe (output tokens), których nie było w zeszłym kwartale. Jeśli nie będziesz tego pilnować, dowiesz się o tym dopiero, gdy przyjdzie rachunek za chmurę.

Szczegółowość rozliczeń LLM sprawia, że jest to szczególnie kłopotliwe. Rzadko płacisz stałą miesięczną stawkę. Płacisz za każdy token promptu i każdy token uzupełnienia (completion). Wzrost cen po stronie wyjściowej może zaboleć bardziej niż po stronie wejściowej, ponieważ uzupełnienia są często dłuższe niż prompty. Jeśli Twoja aplikacja generuje długie teksty, kod lub wieloetapowe łańcuchy rozumowania, niewielki wzrost ceny za token szybko się skaluje.

Istnieje również problem dryfu (drift). Profil tokenów Twojej aplikacji zmienia się w czasie. Możesz dodać nowy system prompt, który zużywa więcej tokenów wejściowych. Możesz przejść na prompting typu chain-of-thought, który generuje dłuższe wyniki. Nawet gdyby ceny dostawców pozostały bez zmian, Twoje koszty by się przesunęły. Gdy ceny dostawców zmieniają się w tym samym czasie, połączony efekt może zaskoczyć zespół, który nie ma odpowiedniej widoczności danych.

Co się zmieniło

Mancer 2, Novita i StreamLake wprowadziły korekty cenowe. Szczegóły różnią się w zależności od platformy, ale kierunek jest ten sam: struktura kosztów, której używałeś w zeszłym miesiącu, może nie być już aktualna.

Mancer 2 zaktualizował ceny swoich modeli, co oznacza, że deweloperzy korzystający z jego endpointów muszą ponownie przeanalizować koszty pojedynczego zapytania. Jeśli zapisałeś stare cenniki w swojej wewnętrznej dokumentacji, te dane są już nieaktualne.

Novita również dokonała korekt cenowych w swojej ofercie. Dla zespołów, które wybrały Novita, ponieważ mieściła się ona w określonym budżecie, nowe stawki mogą zmienić całkowity koszt posiadania (TCO) trwających projektów.

StreamLake również zmieniło swoją politykę cenową. Wszelkie integracje oparte na wcześniejszym cenniku StreamLake powinny zostać zweryfikowane przed rozpoczęciem kolejnego cyklu rozliczeniowego.

Ponieważ są to trzy różne platformy z trzema różnymi modelami cenowymi, nie ma uniwersalnej zasady mówiącej o tym, czy zapłacisz więcej, czy mniej. Jeden dostawca mógł obniżyć stawki dla poziomu startowego, jednocześnie podnosząc ceny za przepustowość premium. Inny mógł skorygować dopłaty za okno kontekstowe (context window). Jedynym bezpiecznym założeniem jest to, że Twój stary arkusz kalkulacyjny jest błędny.

Ukryte koszty ignorowania zmian stawek

Przyjrzyjmy się, co to oznacza w praktyce. Załóżmy, że prowadzisz asystenta wsparcia klienta, który obsługuje dziesięć tysięcy rozmów dziennie. Każda wymiana zdań to średnio dwa tysiące tokenów wejściowych i czterysta tokenów wyjściowych. Zmiana rzędu zaledwie kilku centów na milion tokenów może sumować się do setek dolarów miesięcznie. Jeśli zmiana ceny dotyczy tokenów wyjściowych, a Twój asystent zacznie generować dłuższe odpowiedzi, ponieważ ulepszyłeś model, zostaniesz uderzony podwójnie.

Istnieje również efekt mnożnika. Wiele aplikacji nie wywołuje LLM tylko raz na żądanie użytkownika. Wywołują go w pętli, w potoku (pipeline) z krokami wyszukiwania (retrieval) lub z mechanizmami awaryjnymi (fallbacks) do modeli pomocniczych. Zmiana ceny modelu awaryjnego może nie wydawać się pilna, dopóki Twój główny model nie napotka limitu zapytań (rate limit) i nie spędzisz deszczowej środy, przepalając budżet na droższy model zapasowy.

Przekroczenie budżetu to nie jedyne ryzyko. Jeśli ceny spadną, a Ty tego nie zauważysz, możesz niepotrzebnie ograniczać zużycie. Mógłbyś obsłużyć więcej użytkowników, przetworzyć większe dokumenty lub obniżyć własne ceny dla klientów. Ignorancja działa w obie strony.

Jak wypracować nawyk śledzenia kosztów

Nie potrzebujesz całego działu finansowego w korporacji, aby panować nad tymi wydatkami. Potrzebujesz rutyny i miejsca do logowania zmian.

Zacznij od scentralizowania swoich cenników. Prowadź prosty dokument – czy to wspólną stronę w wiki, tabelę w Notion, czy przypiętą wiadomość na kanale deweloperskim – który zawiera aktualne ceny za token lub zapytanie dla każdego używanego przez Ciebie modelu. Gdy dostawca ogłosi zmianę, natychmiast zaktualizuj dokument. Nie czekaj na przegląd sprintu.

Następnie oznaczaj swoje zużycie według dostawcy i modelu. Większość narzędzi do observability pozwala na dołączanie własnych metadanych do wywołań API. Wykorzystaj te tagi do generowania cotygodniowych podsumowań kosztów. Jeśli zauważysz nagły wzrost, będziesz mógł w kilka sekund (a nie dni) ustalić, czy wynika on ze zwiększonego zużycia, czy ze zmiany stawek.

Stwórz alert dotyczący tempa wydatków (burn-rate). Nie musi to być nic skomplikowanego. Wystarczy zaplanowany skrypt, który odpytuje Twój pulpit nawigacyjny zużycia i każdego ranka wysyła liczbę na Slacka. Gdy wartość gwałtownie wzrośnie, dowiesz się o tym tego samego dnia, a nie po trzydziestu dniach, gdy dział finansowy wyśle wściekłego maila.

Przeglądaj wybory modeli raz na kwartał. Model, który był najlepszy dla Twojego przypadku w styczniu, może nie być już taki w czerwcu – nie dlatego, że stał się gorszy, ale dlatego, że zmienił się krajobraz cenowy. Dostawca, który kiedyś był zbyt drogi, mógł obniżyć stawki. Z kolei Twój tani ulubieniec mógł je podnieść. Przeprowadzaj benchmarki w oparciu o aktualne ceny, a nie historyczne.

Na koniec uwzględnij ceny w decyzjach architektonicznych. Jeśli wiesz, że dany dostawca często zmienia stawki, zaprojektuj system tak, abyś mógł podmienić endpointy bez konieczności przepisywania połowy kodu. Ukryj klienta za wewnętrznym interfejsem. Przechowuj nazwę modelu w pliku konfiguracyjnym, a nie na sztywno w warstwie promptów.

Gdzie szukać rzetelnych informacji

Blogi i dokumentacja dostawców to oficjalne źródła, ale łatwo je przeoczyć w trakcie intensywnego tygodnia. Jedną z opcji jest śledzenie starannie wyselekcjonowanych zestawień, które monitorują właśnie tego typu zmiany w całym ekosystemie. Aby zapoznać się z pełną analizą ostatnich zmian u Mancer 2, Novita i StreamLake, sprawdź szczegółowe podsumowanie tutaj:

Zmiany w cenach LLM: Mancer 2, Novita i StreamLake

Jeśli chcesz być na bieżąco i wymieniać się uwagami z innymi twórcami, którzy starają się utrzymać rachunki za infrastrukturę AI w ryzach, warto dołączyć do społeczności:

GyaanSetu AI na Telegramie

Najlepszą obroną przed niespodziewanymi rachunkami jest sieć ludzi, którzy sygnalizują zmiany w momencie ich wystąpienia.

Kluczowy wniosek

Zmienność cen to cecha obecnego rynku LLM, a nie błąd. Koszty uruchamiania modeli spadają, dostawcy eksperymentują ze strukturami stawek, a konkurencja wpływa na kształtowanie się liczb. W dłuższej perspektywie to dobra wiadomość, ale tylko pod warunkiem, że zwracasz na to uwagę. Traktuj koszty API tak samo jak metryki czasu dostępności (uptime): mierz je, ustawiaj na nie alerty i regularnie je weryfikuj. Ostatnie zmiany u Mancer 2, Novita i StreamLake to tylko kolejny dowód na to, że cena Twojego stosu AI nigdy nie jest w pełni stała.