AWS dodało opcję „prefix-aware routing” (routing uwzględniający prefiksy) do Amazon SageMaker Inference, obiecując wyższe wskaźniki trafień w pamięci podręcznej (cache-hit rates) oraz zauważalnie niższe opóźnienia dla klientów uruchamiających duże modele językowe (LLM) na własnej infrastrukturze. Zmiana ta jest istotna, ponieważ zapewnia wyraźnie niższe opóźnienia i redukuje koszty obliczeń GPU.

Dlaczego opóźnienia LLM są istotne

Gdy model LLM otrzymuje żądanie, zazwyczaj ponownie oblicza mechanizm uwagi (attention) dla całego promptu – jest to kosztowny krok, którego koszt rośnie wraz z każdym dodanym tokenem. Jeśli model może ponownie wykorzystać pamięć podręczną mechanizmu uwagi (attention cache) z poprzedniego żądania, musi przetworzyć jedynie nową część tekstu. Obciążenia, które wielokrotnie wysyłają ten sam prompt systemowy lub utrzymują historię konwersacji, są idealnymi kandydatami do ponownego wykorzystania pamięci podręcznej.

W domyślnej konfiguracji SageMaker przychodzące żądania są rozdzielane losowo pomiędzy pulę instancji wnioskowania. Losowy rozkład oznacza, że żądanie, które mogłoby trafić do „ciepłej” pamięci podręcznej, często trafia na „zimną” instancję, co wymusza pełne ponowne obliczenia. Skutkuje to wyższymi opóźnieniami i dodatkowymi cyklami GPU, co bezpośrednio przekłada się na wyższe wydatki.

Jak działa prefix-aware routing

Nowy tryb routingu przechowuje lekką mapę ostatnich prefiksów żądań – w zasadzie pierwszej części promptu, która ma tendencję do pozostawania niezmiennej w kolejnych wywołaniach. Gdy przychodzi nowe żądanie, SageMaker sprawdza mapę i przekazuje je do instancji, która przetworzyła już ten sam prefiks. Jeśli instancja wciąż przechowuje odpowiednią pamięć podręczną mechanizmu uwagi, model może pominąć większość pracy i szybciej wygenerować odpowiedź.

Kluczowe punkty:

  • Brak konieczności zmian w kodzie – funkcja działa całkowicie w warstwie usługi wnioskowania.
  • Dotyczy tylko modeli hostowanych samodzielnie (self-hosted) – usługi zarządzane, takie jak API OpenAI czy usługa Anthropic, nie są objęte tą zmianą.
  • Przejrzystość dla aplikacji – ten sam adres URL punktu końcowego (endpoint) SageMaker oraz kontrakt API pozostają bez zmian.

Kto może na tym zyskać

Przedsiębiorstwa hostujące modele LLM na SageMaker robią to z różnych powodów, od prywatności danych po kontrolę kosztów. Dla tych, którzy prowadzą chatboty wsparcia, asystentów sprzedaży lub jakichkolwiek interaktywnych agentów, którzy wielokrotnie używają stałego promptu systemowego, ta poprawka w routingu może skrócić średni czas odpowiedzi. Pod kątem kosztów, każde trafienie w pamięć podręczną oszczędza GPU przed koniecznością ponownej ewaluacji wspólnej części promptu.

Ograniczenia i kontrargumenty

Korzyść zależy od obecności powtarzających się prefiksów. Bardzo zmienne prompty – takie jak jednorazowe zapytania lub dynamicznie generowane wiadomości systemowe – nie odnotują tak dużych korzyści z trafień w pamięć podręczną.

Ponieważ funkcja jest ograniczona do wdrożeń typu self-hosted, klienci korzystający z zarządzanych usług LLM nie mogą z niej skorzystać.

Podsumowanie: Prefix-aware routing daje użytkownikom SageMaker prosty sposób (bez pisania kodu), aby zminimalizować opóźnienia w powtarzalnych obciążeniach LLM, jednocześnie obniżając koszty GPU. Dla organizacji, które już hostują modele na tej platformie, aktualizacja ta jest niskoryzykowną zmianą, która może przełożyć się na szybszą interakcję z użytkownikami i niższe rachunki.