Tytuł: Zmień nazwę narzędzia, stracisz cały cache

Nowy model rozliczeń cache u Anthropic oznacza, że drobna zmiana jednego znaku — zmiana nazwy narzędzia lub dodanie znacznika czasu do system promptu — może zmienić tani cache hit w kosztowny cache miss, zwiększając rachunki nawet kilkudziesięciokrotnie.

Ta zmiana wynika z dwupoziomowego systemu zniżek na cache od Anthropic. W przypadku niektórych modeli odczyt z cache kosztuje tylko 0,025 × standardową cenę inputu; w innych zniżka wynosi 0,1 ×. Zniżka ma zastosowanie tylko wtedy, gdy zapytanie dokładnie odpowiada wcześniej zapisanemu wpisowi w cache. Brak dopasowania (miss) jest rozliczany według podstawowej stawki, przez co różnica między hitem a missem drastycznie rośnie. W praktyce niewielka zmiana promptu może podnieść koszt nawet czterdziestokrotnie względem oczekiwanej kwoty.

Dlaczego ta zmiana jest istotna

Anthropic wprowadziło poziom cache, aby zachęcić do ponownego wykorzystywania identycznych promptów, co jest powszechnym wzorcem w przypadku agentów wielokrotnie wywołujących ten sam zestaw narzędzi. Pomysł jest prosty: raz zapisać wynik kombinacji promptu i narzędzia, a następnie tanio go pobrać przy kolejnych wywołaniach. Nowe mnożniki sprawiają, że strona „pobierania” jest znacznie tańsza, ale jednocześnie drastycznie zwiększają karę za „miss”.

Deweloperzy, którzy budowali agentów w oparciu o stabilne system prompty, widzą teraz, że każde odchylenie — zamierzone lub przypadkowe — przerywa łańcuch cache. Skutkiem jest ukryty podatek od usługi: niższy współczynnik cache-hit bezpośrednio przekłada się na wyższe koszty operacyjne.

Co niszczy cache

Dokumentacja Anthropic opisuje hierarchię, w której zmiany na wyższych poziomach unieważniają wszystko, co znajduje się poniżej. Praktycznym skutkiem jest to, że pozornie nieszkodliwe edycje mogą spowodować kaskadowy wzrost opłat do pełnej stawki.

  • Definicje narzędzi – Dodanie, usunięcie lub zmiana nazwy narzędzia, bądź zmiana jego opisu, czyści cache dla narzędzi, system promptu oraz całej historii wiadomości.
  • Przełącznik web-search – Zmiana wartości logicznej (boolean) umożliwiającej użycie narzędzia wyszukiwania w sieci czyści system prompt i cache wiadomości.
  • Parametr tool-choice – Dostosowanie parametru wybierającego, które narzędzie uruchomić, unieważnia jedynie cache wiadomości.
  • Payloade obrazów – Dodawanie lub usuwanie obrazów wpływa tylko na cache wiadomości.

Typowe wzorce, które deweloperzy nieświadomie wyzwalają:

  1. Zmiana kolejności narzędzi – Niektóre bazy kodu sortują słowniki narzędzi przy każdym wdrożeniu. Nowa kolejność tworzy inny klucz cache, co przy każdym wywołaniu wymusza miss.
  2. Prompty z czasem (timestamp) – Umieszczenie ciągu „wygenerowano o HH:MM:SS” w system prompcie sprawia, że każde zapytanie jest unikalne, co gwarantuje miss.
  3. Rotacja fragmentów promptu – Wymiana powitania lub baneru z wersją zmienia hash promptu i niszczy cache.

Jak wykryć ukryty koszt

Logi użycia Anthropic ujawniają dynamikę cache poprzez trzy pola:

  • cache_read_input_tokens – Tokeny odczytane z wpisu w cache.
  • cache_creation_input_tokens – Tokeny, które spowodowały zapisanie nowego wpisu w cache.
  • input_tokens – Tokeny rozliczane według standardowej stawki (pozostała część po odczytach z cache).

Nagły wzrost input_tokens przy jednoczesnym spadku cache_read_input_tokens sygnalizuje, że coś w stosie promptów uległo zmianie. Monitorowanie tych metryk pozwala zespołom zareagować, zanim rachunek drastycznie wzrośnie.

Reakcja deweloperów

W obliczu nowej rzeczywistości cenowej wiele zespołów traktuje teraz stabilność promptu jako kluczowy parametr wydajnościowy. Typowe strategie obejmują:

  • Statyczne system prompty – Przechowywanie promptu w pliku zarządzanym przez system kontroli wersji i wstrzykiwanie go bez modyfikacji w czasie wykonywania programu.
  • Deterministyczna kolejność narzędzi – Definiowanie list narzędzi bezpośrednio w kodzie, zamiast polegania na kolejności w słowniku lub zewnętrznych generatorach.
  • Usuwanie znaczników czasu – Przeniesienie informacji o logowaniu lub czasie do oddzielnego kanału metadanych, który nie wpływa na ciąg promptu.
  • Testowanie uwzględniające cache – Dodawanie testów jednostkowych, które weryfikują, czy hash pełnego promptu (system + narzędzia + wiadomości) pozostaje stały w różnych wersjach (buildach).

Praktyki te wprowadzają niewielki narzut inżynieryjny, ale chronią przed „ukrytym podatkiem”, jakim stał się obecnie cache miss.

Perspektywa Anthropic

Anthropic argumentuje, że głębsza zniżka motywuje do ponownego wykorzystywania zasobów, co może zmniejszyć ogólne obciążenie obliczeniowe ich serwerów. Dzięki drastycznemu obniżeniu kosztów odczytu z cache, mają nadzieję, że deweloperzy będą projektować agentów, którzy wielokrotnie wywołują ten sam zestaw narzędzi, zamiast stale zmieniać kształt promptów. Ceną za to jest wyższa kara za wywołania niepodlegające ponownemu użyciu, co – według firmy – skłania deweloperów do lepszej higieny promptów.

Krytycy zauważają, że wiele agentów działających w rzeczywistych warunkach musi dostosowywać prompty na bieżąco – dodawanie kontekstu, znaczników czasu czy dynamiczny wybór narzędzi jest często niezbędne. W przypadku takich obciążeń nowy model cenowy może sprawić, że Anthropic stanie się mniej atrakcyjny w porównaniu z dostawcami stosującymi stałą stawkę, niezależnie od trafień w cache.

Na co warto zwrócić uwagę

  • Rewizje cenowe – Anthropic może skorygować mnożniki, jeśli opinie społeczności wykażą, że różnica między trafieniem a nietrafieniem (hit-miss gap) jest zbyt duża.
  • Funkcje cache-control – Przyszłe aktualizacje API mogą pozwolić programistom określać, które części promptu powinny zostać wyłączone z klucza pamięci podręcznej, co zapewni rozwiązanie pośrednie.
  • Reakcje konkurencji – Inni dostawcy LLM mogą dostosować własne modele cache, aby zachować konkurencyjność, oferując albo bardziej płaskie cenniki, albo bardziej szczegółowe mechanizmy kontroli cache.

Podsumowanie

Wraz z nowym cennikiem cache od Anthropic, koszt nietrafienia w pamięć podręczną (prompt miss) nie jest już tylko marginalną niedogodnością; to dźwignia finansowa, która może drastycznie wpłynąć na budżet projektu. Utrzymywanie systemowych promptów, definicji narzędzi i powiązanych metadanych w niezmiennej formie jest obecnie tak samo ważne, jak pisanie wydajnego kodu. Zespoły, które traktują determinizm promptów jako mierzalną metrykę, unikną niespodziewanych rachunków i zachowają kontrolę nad wydatkami na agentów AI.