Amazon Bedrock ermöglicht es Entwicklern nun, Teile eines Prompts zu cachen, wodurch die Kosten für die Token-Nutzung um bis zu 90 % gesenkt und die Antwortlatenz für Anwendungen, die einen statischen Prompt-Präfix wiederverwenden, um bis zu 85 % reduziert werden können.

Warum diese Änderung wichtig ist

Das On-Demand-Ausführen von Large Language Models kostet Geld, jedes Mal, wenn Tokens an das Modell gesendet werden. Chatbots, Code-Assistenten und Tools zur Dokumentensuche senden oft dieselben Systemanweisungen oder Referenzmaterialien erneut, was die Kosten in die Höhe treibt und die Antwortzeiten verlängert.

So funktioniert Prompt Caching

Bedrock fügt ein „cacheable“-Flag hinzu, das Entwickler jedem Segment eines Prompts zuweisen können – typischerweise Systemanweisungen, lange Hintergrunddokumente oder Tool-Definitionen, die sich während einer Sitzung nie ändern. Wenn eine Anfrage eingeht, prüft Bedrock, ob das markierte Segment mit einem gespeicherten Eintrag übereinstimmt. Wenn ja, überspringt der Dienst das erneute Kodieren und Ausführen dieses Teils durch das Modell und greift stattdessen auf die vorab berechnete Repräsentation aus dem Cache zu.

Die Zahlen

  • Input-Token-Kosten: bis zu 90 % Reduzierung, da der gecachte Präfix bei jedem Aufruf keine Tokens mehr verbraucht.
  • Latenz: bis zu 85 % schneller, da die rechenintensiven Aufgaben des Modells für den statischen Teil entfallen.

Ideale Anwendungsfälle

Die Funktion glänzt besonders dann, wenn der Prompt einen großen, unveränderlichen Block enthält, gefolgt von einer kurzen, variablen Benutzeranfrage. Gängige Muster sind:

  • Retrieval-Augmented Generation (RAG)-Pipelines, bei denen jedem Query ein abgerufenes Dokument vorangestellt wird.
  • Kundensupport-Bots, die immer mit derselben Richtlinienerklärung oder einem Text zur Festlegung des Tons beginnen.
  • Coding-Assistenten, die eine feste Sprach-Tool-Definition vor dem Code-Snippet des Entwicklers laden.

Was Entwickler ändern müssen

Entwickler müssen den Prompt so umstellen, dass der statische Inhalt ganz am Anfang steht und über die Aufrufe hinweg bytegenau identisch bleibt. Die variable Benutzereingabe folgt auf den gecachten Präfix. Ein Modellwechsel ist nicht erforderlich; dieselben Bedrock-Endpunkte verarbeiten die Anfrage.

Wer profitiert, wer sollte vorsichtig sein

Der Vorteil gilt nur für Workloads, bei denen der Präfix tatsächlich statisch bleibt. Anwendungen, die Systemanweisungen pro Benutzer personalisieren oder den Kontext häufig ändern, werden nur wenig profitieren und müssen die zusätzliche Komplexität beim Prompting gegen den geringen Gewinn abwägen.

Fazit: Prompt Caching bietet Bedrock-Nutzern einen einfachen Hebel, um die KI-Betriebskosten zu senken und die Antwortzeiten zu verbessern, vorausgesetzt, ihre Anwendungen können einen wiederverwendbaren Prompt-Präfix isolieren.