Amazon Bedrock ora consente agli sviluppatori di memorizzare nella cache parti di un prompt, riducendo le fatture per l'uso dei token fino al 90% e tagliando la latenza di risposta fino all'85% per le applicazioni che riutilizzano un prefisso del prompt statico.
Perché questo cambiamento è importante
L'esecuzione di modelli linguistici di grandi dimensioni (LLM) on-demand ha un costo ogni volta che i token vengono inviati al modello. Chatbot, assistenti alla programmazione e strumenti di ricerca documentale spesso reinviano le stesse istruzioni di sistema o lo stesso materiale di riferimento, gonfiando la spesa e rallentando le risposte.
Come funziona il prompt caching
Bedrock aggiunge un flag "cacheable" che gli sviluppatori possono applicare a qualsiasi segmento di un prompt: tipicamente istruzioni a livello di sistema, lunghi documenti di contesto o definizioni di strumenti che non cambiano mai durante una sessione. Quando arriva una richiesta, Bedrock verifica se il segmento contrassegnato corrisponde a una voce memorizzata. In caso positivo, il servizio evita di ricodificare ed eseguire nuovamente quella parte attraverso il modello, estraendo invece la rappresentazione pre-calcolata dalla cache.
I numeri
- Costo dei token di input: riduzione fino al 90% poiché il prefisso in cache non consuma più token a ogni chiamata.
- Latenza: fino all'85% più veloce, poiché il lavoro pesante del modello viene evitato per la parte statica.
Scenari ideali
Questa funzionalità eccelle quando il prompt contiene un blocco ampio e immutabile seguito da una breve query variabile dell'utente. I pattern comuni includono:
- Pipeline di Retrieval-augmented generation (RAG) che antepongono un documento recuperato a ogni query.
- Bot di assistenza clienti che iniziano sempre con la stessa dichiarazione di policy o con un testo che definisce il tono.
- Assistenti alla programmazione che caricano una definizione fissa di strumenti linguistici prima dello snippet dello sviluppatore.
Cosa devono cambiare gli sviluppatori
Gli sviluppatori devono riordinare il prompt in modo che il contenuto statico si trovi proprio all'inizio e rimanga identico byte per byte tra le varie chiamate. L'input variabile dell'utente segue il prefisso in cache. Non è necessario cambiare modello; gli stessi endpoint di Bedrock gestiscono la richiesta.
Chi ne trae vantaggio e chi deve prestare attenzione
Il vantaggio si applica solo ai carichi di lavoro in cui il prefisso rimane effettivamente statico. Le applicazioni che personalizzano le istruzioni di sistema per ogni utente o che alterano frequentemente il contesto vedranno pochi benefici e dovranno valutare la maggiore complessità del prompting rispetto ai modesti guadagni.
In sintesi: Il prompt caching offre agli utenti Bedrock una leva semplice per ridurre i costi operativi dell'IA e migliorare i tempi di risposta, a condizione che le loro applicazioni possano isolare un prefisso del prompt riutilizzabile.
