Un investigador independiente registró cada token que su agente de investigación impulsado por LLM consumió durante un mes y redujo la factura en un 31 %. El gasto bajó de $945 a $651, mientras que la tasa de éxito subió ligeramente del 91 % al 93 %, un resultado que cualquiera que ejecute flujos de trabajo de IA sensibles al costo notará.

Por qué los datos a nivel de token fueron importantes

La mayoría de los usuarios de LLM solo ven la factura final: una suma global que oculta el costo de cada subtarea. El agente del investigador realizaba tres acciones principales: buscar presentaciones de la SEC, redactar informes y unir síntesis de investigación. Sin datos granulares, no podía saber si los $312 que pagó en junio fueron bien gastados.

Para exponer la fuga oculta, añadió una capa de registro en PostgreSQL que capturaba el nombre del modelo, el recuento de tokens, el tipo de tarea y el costo por llamada. Después de 30 días, los datos mostraron un panorama claro:

  • Búsqueda de presentaciones de la SEC – 41 % del gasto total
  • Redacción de informes – 28 %
  • Síntesis de investigación – 17 %
  • Controles de calidad – 9 %
  • Misceláneos – 5 %

Las cifras mostraron que el paso más costoso no era el modelo en sí, sino cómo el agente introducía los resultados de búsqueda sin procesar en los prompts.

Tres ajustes que impulsaron el ahorro

1. Resumir antes de enviar el prompt

Originalmente, el agente metía 20 resultados de búsqueda sin procesar en cada prompt, inflando la entrada con una gran cantidad de tokens. Primero insertó un resumidor económico, reduciendo drásticamente la entrada. El costo por tarea de búsqueda bajó de $0,84 a $0,19, una reducción del 77 %.

2. Dirigir las comprobaciones simples a un modelo más económico

Los controles de calidad se ejecutaban en un modelo de gama alta que costaba $0,09 por comprobación. Cambió a un modelo de menor precio para la mayoría de las comprobaciones de paso/fallo, reduciendo el precio por comprobación a $0,01. El modelo más económico respondió correctamente el 89 % de las veces; cualquier fallo se escalaba al modelo original, preservando la precisión mientras se reducía el costo en un 87 %.

3. Omitir comprobaciones cuando la confianza es alta

Añadió una regla para omitir el paso de control de calidad siempre que la tasa de éxito histórica de la tarea fuera alta y la longitud de la salida estuviera dentro de los límites esperados. Esto eliminó aproximadamente el 60 % de las comprobaciones que se habrían ejecutado de todos modos.

La recompensa

Con los tres cambios implementados, el balance mensual quedó así:

  • Gasto total: $945 → $651 (reducción del 31 %)
  • Costo de búsqueda de la SEC por tarea: $0,84 → $0,19 (reducción del 77 %)
  • Costo de control de calidad por tarea: $0,09 → $0,01 (reducción del 87 %)
  • Tasa de éxito general: 91 % → 93 %

La mayor tasa de éxito sugiere que los prompts más cortos redujeron el ruido y ayudaron al modelo a centrarse en la pregunta principal.

Advertencias y contraargumentos

El enfoque se basa en dos suposiciones. Primero, el resumidor más económico debe retener suficiente información para el razonamiento posterior; si descarta detalles críticos, la calidad de la salida podría verse afectada. Segundo, el modelo de menor costo utilizado para los controles de calidad no es perfecto; su precisión del 89 % significa que una pequeña fracción de errores aún llega al producto final, aunque la ruta de escalado captura la mayoría. Los usuarios con necesidades de cumplimiento más estrictas podrían necesitar umbrales más ajustados o pasos de validación adicionales.

Qué significa esto para los profesionales de LLM

  • Los paneles granulares ganan. Los informes de gastos de alto nivel ocultan el desperdicio de tokens. Registrar el uso por tarea revela ineficiencias que, de otro modo, permanecerían ocultas.
  • No siempre se requieren modelos de frontera. Un modelo económico puede comprimir datos o tomar decisiones binarias simples sin comprometer la calidad general.

El costo oculto de un agente de LLM es a menudo el trabajo no medido que realiza. Al instrumentar el flujo de tokens y aplicar optimizaciones específicas, el investigador convirtió una factura mensual de $945 en una operación más eficiente de $651, al tiempo que aumentó ligeramente el rendimiento. Para cualquiera que esté presupuestando cargas de trabajo de IA, la lección es clara: mida cada token y luego deje que los datos dicten dónde recortar.