Claude Code gasta tres cuartas partes de su presupuesto de tokens solo leyendo la base de código, según el análisis de Red Hat de 219 sesiones del mundo real. El hallazgo invierte la suposición habitual de que los agentes de codificación impulsados por IA pierden tiempo generando código y sugiere que los desarrolladores deberían atacar el problema de la gestión del contexto, no solo la velocidad del modelo.

Los datos detrás de la afirmación

Red Hat examinó 219 interacciones con Claude Code de Anthropic y calculó el uso de tokens por turno. En la muestra, el turno mediano asignó el 75 % de los tokens a la ingesta del código y la documentación circundantes, mientras que solo el 25 % se destinó a la producción de nuevas líneas. Debido a que la mayoría de los proveedores de IA cobran los tokens de entrada y salida a la misma tarifa, la mitad de la transacción dedicada a la "lectura" impulsa la mayor parte del costo.

Por qué importa el costo de lectura

Estrategia de optimización

Muchos equipos invierten recursos en modelos más rápidos o grandes, con la esperanza de que un aumento de velocidad reduzca segundos en cada generación. Si tres cuartas partes del trabajo consisten simplemente en incorporar contexto, un modelo más rápido solo ahorra una fracción del tiempo total. La verdadera palanca es cuánto contexto tiene que procesar el modelo en cada turno.

Control de costos

Cuando un asistente de IA vuelve a leer el mismo estado del repositorio en cada solicitud, los tokens de entrada se disparan. Los proyectos con ventanas de contexto grandes pueden ver cómo sus facturas aumentan drásticamente, incluso si la cantidad de código generado se mantiene modesta.

Enfoque de ingeniería

Los creadores de herramientas a menudo buscan una mayor calidad del modelo mientras pasan por alto cómo se construyen los prompts. El análisis sugiere que la "ingeniería de contexto" (recortar, almacenar en caché y resumir el código que se le entrega al modelo) ofrece un mayor ROI que las actualizaciones incrementales de los modelos.

Pasos prácticos para reducir la sobrecarga de lectura

  • Podar archivos irrelevantes – Elimine del prompt los archivos que la tarea actual no necesita. Los prompts más pequeños significan menos tokens de entrada.
  • Almacenar en caché las lecturas repetidas – Guarde la interpretación del modelo de las partes estables de la base de código y reutilícela en los distintos turnos en lugar de volver a enviar el mismo texto.
  • Comprimir las salidas de las herramientas – Cuando las herramientas externas devuelvan grandes bloques de datos (por ejemplo, informes de lint), resúmalos antes de volver a enviarlos a Claude.
  • Usar diffs incrementales – Envíe solo los cambios realizados desde el último turno en lugar del contenido completo del archivo.

Estas tácticas tienen como objetivo evitar que la IA vuelva a leer la misma instantánea del repositorio en cada interacción, reduciendo tanto la latencia como el costo.

Contraargumento: la velocidad sigue importando

Algunos desarrolladores argumentan que un modelo más rápido sigue siendo importante porque reduce la latencia del 25 % de los tokens que se generan. En entornos sensibles a la latencia —como los complementos de IDE que deben responder instantáneamente— cada milisegundo cuenta. El perfil dominado por la lectura no elimina el beneficio de un modelo más veloz; simplemente reduce su impacto relativo.

Qué observar a continuación

El estudio de Red Hat se basa en un conjunto limitado de sesiones, por lo que un muestreo más amplio podría revelar distribuciones de tokens diferentes para otros lenguajes o tamaños de proyecto. Si los datos futuros confirman la cifra del 75 % de lectura, podríamos ver un cambio hacia herramientas que recorten y almacenen el contexto automáticamente, o incluso arquitecturas de modelos ajustadas para una ingesta rápida de contexto.

Conclusión: Para la codificación asistida por IA, la mejora de rendimiento más económica proviene de alimentar menos al modelo, no de hacer que escriba más rápido. Las cifras de Red Hat presentan un caso claro: recorte, almacene en caché y resuma sus prompts, y verá ahorros tangibles tanto en tiempo como en dinero.