Amazon Bedrock umożliwia teraz programistom buforowanie części promptu, co pozwala zmniejszyć rachunki za zużycie tokenów nawet o 90% i skrócić opóźnienia w odpowiedziach nawet o 85% w przypadku aplikacji ponownie wykorzystujących statyczny prefiks promptu.

Dlaczego ta zmiana jest ważna

Uruchamianie dużych modeli językowych na żądanie generuje koszty przy każdym przesłaniu tokenów do modelu. Chatboty, asystenci kodu i narzędzia do przeszukiwania dokumentów często ponownie przesyłają te same instrukcje systemowe lub materiały referencyjne, co zwiększa wydatki i spowalnia odpowiedzi.

Jak działa buforowanie promptu

Bedrock dodaje flagę „cacheable”, którą programiści mogą przypisać do dowolnego segmentu promptu — zazwyczaj są to instrukcje na poziomie systemowym, długie dokumenty kontekstowe lub definicje narzędzi, które nie zmieniają się w trakcie sesji. Gdy przychodzi zapytanie, Bedrock sprawdza, czy oznaczony segment zgadza się z zapisanym wpisem. Jeśli tak, usługa pomija ponowne kodowanie i ponowne przetwarzanie tej części przez model, zamiast tego pobierając gotową reprezentację z pamięci podręcznej.

Liczby

  • Koszt tokenów wejściowych: redukcja nawet o 90%, ponieważ buforowany prefiks nie zużywa już tokenów przy każdym wywołaniu.
  • Opóźnienie: nawet o 85% szybciej, ponieważ w przypadku części statycznej unika się najbardziej obciążających operacji modelu.

Najlepsze scenariusze zastosowań

Funkcja ta sprawdza się najlepiej, gdy prompt zawiera duży, niezmienny blok, po którym następuje krótka, zmienna zapytanie użytkownika. Typowe wzorce obejmują:

  • Potoki generowania wspomaganego wyszukiwaniem (RAG), które do każdego zapytania dopisują pobrany dokument.
  • Boty wsparcia klienta, które zawsze zaczynają od tego samego oświadczenia o polityce lub tekstu ustalającego ton wypowiedzi.
  • Asystenci kodowania, którzy ładują stałą definicję narzędzia językowego przed fragmentem kodu programisty.

Co muszą zmienić programiści

Programiści muszą zmienić kolejność w prompcie tak, aby treść statyczna znajdowała się na samym początku i pozostawała identyczna bajt po bajcie w kolejnych wywołaniach. Zmienne dane wejściowe użytkownika powinny następować po buforowanym prefiksie. Nie jest wymagana zmiana modelu; te same punkty końcowe (endpoints) Bedrock obsługują zapytanie.

Kto zyskuje, a kto powinien zachować ostrożność

Korzyści dotyczą wyłącznie obciążeń, w których prefiks rzeczywiście pozostaje statyczny. Aplikacje, które personalizują instrukcje systemowe dla każdego użytkownika lub często zmieniają kontekst, odniosą niewielkie korzyści i muszą zestawić zwiększoną złożoność tworzenia promptów z niewielkimi zyskami.

Podsumowując: Buforowanie promptu daje użytkownikom Bedrock proste narzędzie do obniżenia kosztów operacyjnych AI i skrócenia czasu odpowiedzi, pod warunkiem, że ich aplikacje potrafią wyodrębnić wielokrotnego użytku prefiks promptu.