El experimento de un desarrollador independiente con tres modelos de Claude redujo drásticamente los costes mensuales de la API en un 35 % y disminuyó la latencia media de las tareas de 42 a 27 segundos. Al enrutar las tareas sencillas y de baja ambigüedad al económico modelo Haiku, el trabajo rutinario a Sonnet y reservar el pesado Opus para problemas críticos, el autor demostró que la costumbre de usar "el mejor modelo para todo" es un hábito costoso.
Por qué el enrutamiento era importante
El autor gestiona un agente de codificación autónomo que recibe un flujo constante de tareas de desarrollo: correcciones de lint, adición de funcionalidades, revisiones de seguridad y sesiones de depuración profunda. Durante meses, el agente envió cada solicitud a Opus, el modelo Claude más capaz, asumiendo que una mayor calidad siempre compensaría el precio. Opus tiene un precio premium por token, por lo que la factura crecía sin control.
Cuando el autor introdujo un esquema de enrutamiento por niveles, el gasto cayó al 65 % de su nivel original y el uso de Opus bajó al 11 % del total de las tareas.
Cómo funciona el sistema de tres niveles
La lógica de enrutamiento se basa en la ambigüedad, no en cuántas líneas de código afecte una tarea. El autor definió tres categorías:
- Haiku – tareas deterministas y de baja ambigüedad. Ejemplos: corregir advertencias de lint, renombrar variables, resumir archivos de registro (logs). La respuesta correcta suele ser una sola línea de código o texto.
- Sonnet – el caballo de batalla por defecto. Se encarga de la implementación de funcionalidades, correcciones de errores rutinarias y refactorizaciones estándar donde el problema está claro pero la solución puede implicar varios pasos.
- Opus – trabajo de alta ambigüedad y gran importancia. Decisiones de arquitectura, auditorías de seguridad, sesiones de depuración complejas o cualquier tarea donde el camino correcto no sea claro y un error pudiera romper el pipeline.
Una tabla de búsqueda estática asigna cada solicitud entrante al modelo adecuado basándose en estas reglas. El autor probó un modelo "inteligente" que decidiría el nivel sobre la marcha, pero el uso adicional de tokens anuló cualquier ahorro. Las reglas estáticas simples cubrieron aproximadamente el 80 % de la carga de trabajo y mantuvieron el sistema económico y predecible.
La red de seguridad de escalada
Los modelos económicos también cometen errores. Para evitar que una respuesta errónea de Haiku o Sonnet descarrile la compilación, el sistema escala una solicitud tras dos fallos, promoviéndola al siguiente nivel. Esta red de seguridad detecta los errores rápidamente y mantiene el pipeline funcionando sin intervención manual.
Números que hablan por sí solos
Tras cuatro semanas de funcionamiento del enrutador por niveles, el autor registró estos cambios:
- El gasto en la API cayó al 65 % del coste original (una reducción del 35 %).
- El tiempo medio de respuesta bajó de 42 a 27 segundos.
- El uso de Opus se redujo de gestionar cada solicitud a solo el 11 % de las tareas totales.
Estas cifras demuestran que la mayor parte del trabajo de desarrollo puede delegarse en modelos más económicos sin una caída notable en la calidad, mientras que los problemas más difíciles siguen beneficiándose de la mayor ventana de contexto de Opus.
Lecciones para otros desarrolladores
- Empieza por lo bajo, no por lo alto. La mayoría de las tareas diarias de programación no necesitan el modelo más potente. Establecer Sonnet como predeterminado para tareas ambiguas ahorró más dinero que pasar todo por Haiku.
- Mide la dificultad, no el tamaño. La corrección de una condición de carrera de una sola línea puede ser más difícil que refactorizar un archivo completo. Enruta según la ambigüedad de la solución, no por el número de líneas modificadas.
- Vigila la tasa de escalada. Un aumento en el número de escaladas indica que las reglas estáticas ya no se ajustan a la carga de trabajo. Ajusta las categorías antes de que los modelos económicos empiecen a causar más fallos en el pipeline.
Reservar el modelo más caro para los problemas más difíciles y dejar que los modelos más económicos se encarguen del resto mantiene el desarrollo asistido por IA rápido y asequible. La verdadera ventaja reside en una estrategia de enrutamiento disciplinada que asigne la herramienta adecuada al trabajo adecuado.
