La nueva API de prompt-caching de Claude Opus 5 reduce drásticamente las facturas de tokens para aplicaciones de chat al permitir que el modelo omita la relectura de texto que no ha cambiado. La primera solicitud conlleva un pequeño sobrecoste; cada interacción posterior cuesta aproximadamente una décima parte de la tarifa base, convirtiendo un gasto recurrente en un cargo único.

Por qué los desarrolladores pagan dos veces por las mismas palabras

La mayoría de las interfaces conversacionales reconstruyen el prompt completo en cada turno: un prompt de sistema de 8.000 tokens, PDFs adjuntos y todo el historial de diálogo se envían juntos al modelo cada vez que un usuario hace una pregunta de seguimiento. El modelo vuelve a procesar cada token, aunque la mayor parte de ese texto nunca cambie. Con los precios actuales, esa redundancia puede dominar el coste de un bot con mucha actividad.

Cómo el caché cambia las cuentas

La API crea una entrada de caché para cada "bloque" de tokens hasta un punto de interrupción (breakpoint) definido. Cuando la siguiente solicitud contiene el mismo bloque al principio, el servicio lo lee desde el caché en lugar de volver a tokenizarlo. El desglose de precios refleja el trabajo ahorrado:

  • Escritura en caché – TTL de 5 minutos: 1,25 × precio base
  • Escritura en caché – TTL de 1 hora: 2 × precio base
  • Lectura de caché (hit): 0,1 × precio base

En la práctica, la primera llamada a un bloque nuevo cuesta un poco más que una solicitud normal. Cada llamada posterior que aprovecha el caché es un 90 % más barata, por lo que el gasto neto disminuye drásticamente a medida que la conversación avanza.

La "regla de oro" para estructurar prompts

La eficacia del caché depende de dónde coloques el contenido estático frente al dinámico. Pon todo lo que se mantiene igual al principio y desplaza las piezas que cambian constantemente hacia el final. Un orden fiable es el siguiente:

  1. Tools – definiciones de cualquier función externa que el modelo pueda llamar.
  2. System instructions – el comportamiento de alto nivel que quieres que siga el modelo.
  3. Documents – contexto largo como PDFs, bases de conocimiento o extractos de políticas.
  4. User questions – la consulta en vivo que varía en cada turno.

Si modificas cualquier token antes de un punto de interrupción, la entrada de caché se invalida y el modelo debe volver a procesar todo lo que le sigue.

Límites ocultos que debes respetar

  • Tamaño mínimo de bloque – Opus 5 solo almacena en caché bloques que contengan al menos 512 tokens. Cualquier cosa más pequeña queda totalmente fuera del caché.
  • Error de marca de tiempo (timestamp bug) – insertar una marca de tiempo cambiante dentro de un bloque en caché garantiza un fallo (miss), ya que el texto del bloque nunca coincidirá exactamente.
  • Búsqueda de 20 bloques hacia atrás – el servicio solo escanea los últimos 20 bloques para encontrar una coincidencia. Las sesiones largas que avanzan rápidamente pueden superar la ventana del caché.
  • Solicitudes paralelas – enviar varias solicitudes idénticas al mismo tiempo resultará en fallos de caché, ya que este se puebla solo después de que finaliza la primera solicitud. Calienta el caché con una sola llamada y luego realiza el resto.

Ver los ahorros en la respuesta de tu API

Cada respuesta informa de tres contadores de tokens:

  • cache_read_input_tokens – tokens que procedieron de una lectura de caché (hit).
  • cache_creation_input_tokens – tokens escritos en el caché en esta solicitud.
  • input_tokens – los nuevos tokens que no estaban en el caché.

Suma los tres números para obtener el total de tokens que el modelo tuvo en cuenta para ese turno. Si ambos campos de caché son cero, la solicitud no encontró el caché; comprueba el tamaño de tus bloques y la ubicación de los puntos de interrupción.

Conclusión: Al priorizar el contexto inmutable y dejar que la API de prompt-caching de Claude Opus 5 haga el trabajo pesado, conviertes un gasto recurrente de tokens en un cargo único. El resultado es una reducción drástica de costes para cualquier chatbot que haga referencia repetidamente al mismo prompt de sistema o conjunto de documentos, siempre que respetes el límite mínimo de tokens, evites marcadores mutables dentro de los bloques en caché y mantengas tu contenido apto para el caché dentro del horizonte de 20 bloques.