AWS hat eine „prefix-aware Routing“-Option zu Amazon SageMaker Inference hinzugefügt, die höhere Cache-Hit-Raten und spürbar geringere Latenzzeiten für Kunden verspricht, die Large Language Models (LLMs) auf ihrer eigenen Infrastruktur betreiben. Die Änderung ist wichtig, da sie eine deutlich geringere Latenz und reduzierte GPU-Rechenkosten bietet.

Warum LLM-Latenz wichtig ist

Wenn ein LLM eine Anfrage erhält, berechnet es normalerweise die Attention über den gesamten Prompt neu – ein kostspieliger Schritt, der mit jedem hinzugefügten Token wächst. Wenn das Modell den Attention-Cache einer vorherigen Anfrage wiederverwenden kann, muss es nur den neuen Teil des Textes verarbeiten. Workloads, die wiederholt denselben System-Prompt senden oder einen Konversationsverlauf beibehalten, sind ideale Kandidaten für die Cache-Wiederverwendung.

In der Standardeinstellung von SageMaker werden eingehende Anfragen zufällig auf den Pool der Inferenz-Instanzen verteilt. Eine zufällige Verteilung bedeutet, dass eine Anfrage, die einen warmen Cache hätte nutzen können, oft auf einer kalten Instanz landet, was eine vollständige Neuberechnung erzwingt. Das Ergebnis sind höhere Latenzzeiten und zusätzliche GPU-Zyklen, die sich direkt in höheren Kosten niederschlagen.

So funktioniert prefix-aware Routing

Der neue Routing-Modus führt eine leichtgewichtige Map der jüngsten Request-Präfixe – im Wesentlichen der erste Teil eines Prompts, der über verschiedene Aufrufe hinweg meist konstant bleibt. Wenn eine neue Anfrage eintrifft, prüft SageMaker die Map und leitet die Anfrage an eine Instanz weiter, die denselben Präfix bereits verarbeitet hat. Wenn die Instanz den relevanten Attention-Cache noch hält, kann das Modell den Großteil der Arbeit überspringen und die Antwort schneller generieren.

Wichtige Punkte:

  • Keine Code-Änderungen erforderlich – die Funktion befindet sich vollständig in der Inferenz-Service-Schicht.
  • Gilt nur für selbst gehostete Modelle – verwaltete Angebote wie die API von OpenAI oder der Service von Anthropic sind nicht betroffen.
  • Transparent für Anwendungen – dieselbe SageMaker-Endpunkt-URL und derselbe API-Kontrakt bleiben bestehen.

Wer davon profitiert

Unternehmen, die LLMs auf SageMaker hosten, tun dies aus verschiedenen Gründen, die von Datenschutz bis hin zur Kostenkontrolle reichen. Für diejenigen, die Support-Chatbots, Verkaufsassistenten oder andere interaktive Agenten betreiben, die wiederholt einen festen System-Prompt verwenden, kann die Routing-Optimierung die durchschnittlichen Antwortzeiten verkürzen. Auf der Kostenseite spart jeder Cache-Hit der GPU die Neuberechnung des gemeinsamen Teils des Prompts.

Grenzen und Gegenargumente

Der Nutzen hängt vom Vorhandensein wiederholter Präfixe ab. Hochgradig variable Prompts – wie einmalige Abfragen oder dynamisch generierte Systemnachrichten – werden nicht denselben Vorteil durch Cache-Hits erzielen.

Da die Funktion auf selbst gehostete Deployments beschränkt ist, können Kunden, die an verwaltete LLM-Dienste gebunden sind, sie nicht nutzen.

Fazit: Prefix-aware Routing bietet SageMaker-Nutzern eine einfache Zero-Code-Möglichkeit, die Latenz bei repetitiven LLM-Workloads zu minimieren und gleichzeitig die GPU-Kosten zu senken. Für Organisationen, die bereits Modelle auf der Plattform hosten, ist das Upgrade eine risikoarme Optimierung, die zu schnelleren Benutzerinteraktionen und niedrigeren Rechnungen führen kann.