El registro de memoria de un agente LLM en producción creció de un archivo de 2 KB a 29.446 bytes, lo que aumentó el recuento de tokens que el agente lee de unos 500 a 7.360 por ejecución; un gasto oculto que apareció sin ninguna alerta en el panel de monitoreo. El desarrollador detrás del agente afirma que el aumento silencioso en el costo de lectura es un ejemplo concreto de “agent cost drift” (deriva de costos del agente), un problema que puede erosionar los presupuestos incluso cuando el sistema parece funcionar normalmente.
¿Qué es el agent cost drift?
El agent cost drift describe el aumento gradual en el costo computacional de las operaciones rutinarias de un agente de IA, causado por el crecimiento del propio estado del agente. En el ejemplo, el agente mantiene un archivo de registro de trabajo que registra por qué rechazó temas de artículos anteriores. Cada nueva entrada añade un párrafo de razonamiento, y el archivo se lee por completo antes de que el agente genere contenido nuevo. Debido a que el registro se expande de forma cuadrática —cada entrada no solo añade su propia longitud, sino que también hace referencia a entradas anteriores—, la cantidad de texto que el agente debe ingerir se acelera con el tiempo.
La deriva no es un pico o un fallo; es un impuesto lineal que se acumula. El agente sigue produciendo dos artículos al día y el panel no muestra errores, pero cada ejecución consume ahora 7.360 tokens, frente a los aproximadamente 500 de hace un mes. Dado que la mayoría de los proveedores de LLM cobran por token, el aumento de tokens por ejecución se traduce directamente en mayores costos operativos.
Por qué es importante
- Impacto en el presupuesto – El modelo de precios basado en tokens significa que cada token extra leído es dinero gastado. El recuento de tokens aumentó de 500 a 7.360.
La mecánica oculta
El patrón de crecimiento del archivo es clave. Un registro línea por línea que simplemente añada nuevas entradas aumentaría de forma lineal, pero como cada entrada explica el razonamiento detrás de los rechazos anteriores, la longitud del texto se acumula. El resultado es una curva de crecimiento cuadrática: duplicar el número de entradas más que duplica el tamaño del archivo, y el recuento de tokens necesario para procesarlo crece aún más rápido.
Los desarrolladores rara vez detectan el aumento de costos porque cada entrada "tiene sentido por sí misma". La salida del agente sigue siendo correcta y el registro continúa cumpliendo su propósito, ocultando la ineficiencia.
Estrategia de mitigación
El desarrollador propone una reestructuración del registro en tres partes:
- Archivo de entradas recientes – Mantener un archivo pequeño y de lectura activa que contenga solo las últimas entradas necesarias para evitar repeticiones inmediatas.
- Índice compacto – Almacenar un resumen de una sola línea para las entradas más antiguas. El índice se puede escanear rápidamente para verificar la duplicación de temas sin tener que cargar párrafos completos.
- Texto completo archivado – Mover todo el razonamiento histórico a un archivo de archivo separado que el agente no lea durante su operación normal.
Este enfoque preserva la capacidad del agente para evitar la repetición de temas, al tiempo que reduce drásticamente la carga de tokens por ejecución.
Cómo detectar la deriva de costos en sus agentes
- Instrumentar las lecturas de tokens – Registrar el número de tokens que consume el agente al cargar su archivo de memoria cada vez que se ejecuta.
- Realizar un seguimiento en el tiempo – Comparar el recuento de tokens de hoy con el de hace una semana o un mes. Una tendencia ascendente constante indica una deriva.
Simplemente verificar que el archivo se carga sin errores es insuficiente; debe medir el costo de esa carga.
Qué observar a continuación
El agent cost drift es un impuesto invisible que puede erosionar silenciosamente su presupuesto de IA. Al tratar el archivo de memoria del agente como un centro de costos —midiendo las lecturas de tokens, observando las curvas de crecimiento y reestructurando los registros—, puede mantener el impuesto bajo y los resultados precisos.
Únase a la discusión: https://t.me/GyaanSetuAi
