Un equipo de investigación construyó un enrutador para decidir si un modelo de lenguaje económico podía manejar una solicitud de programación, con la esperanza de reducir los costos de inferencia, pero el enrutador no pudo superar un nivel de referencia (baseline) de "nunca escalar". El fracaso muestra por qué las métricas centradas en la precisión confunden a las cascadas y señala las señales que realmente capturan la dificultad.

Por qué el enrutador era importante

Las cascadas de modelos envían cada solicitud al modelo más pequeño que pueda responderla correctamente. Si el enrutador envía un prompt sencillo a un modelo económico, el sistema se ahorra el costoso cómputo necesario para un modelo más grande. El equipo entrenó un enrutador con 539 tareas de programación reales (428 fáciles y 111 difíciles), esperando que aprendiera cuándo sería suficiente el modelo económico.

Las cifras que no alcanzaron las expectativas

  • AUC de validación (área bajo la curva ROC): 0.594
  • Rango de validación cruzada de 5 pliegues: 0.55 – 0.57
  • Mejor umbral: coincide con una política de "nunca escalar"

El AUC de validación fue de 0.594 y la validación cruzada osciló entre 0.55 y 0.57, lo que significa que el clasificador apenas separa los casos fáciles de los difíciles. Cuando el umbral óptimo reproduce una política que nunca utiliza el modelo costoso, el enrutador no aporta valor. Se comporta como un predictor constante en lugar de un tomador de decisiones.

Qué probaron los experimentos

Los investigadores compararon tres conjuntos de características:

Conjunto de características AUC
11 características superficiales simples (p. ej., recuento de tokens, presencia de palabras clave) 0.610
Embedding de prompt de 1024 dimensiones (vector semántico) 0.552
Ambos combinados 0.609

Sorprendentemente, las características superficiales ligeras superaron al embedding semántico de alta dimensión. El embedding capturó el tema del prompt, pero no su dificultad intrínseca. Al alimentar al enrutador con el borrador del modelo económico, el AUC aumentó a 0.640, lo que sugiere que las señales que aparecen durante la generación son más informativas que las presentes únicamente en el prompt.

Dos errores fundamentales

1. La precisión es la medida incorrecta

Un enrutador debe mejorar la relación costo-precisión en comparación con una política ingenua, no solo predecir la corrección. Si no puede superar la estrategia de "nunca escalar", no ofrece ningún beneficio de costo, independientemente de la precisión bruta. Las métricas tradicionales como el AUC ignoran la dimensión económica de una cascada.

2. "Escalar siempre" no es el techo

El experimento asumió que el modelo costoso era infalible, tratando el "usar siempre el modelo grande" como el límite superior. En realidad, el modelo más grande a veces arruinaba respuestas que el modelo económico acertaba. Un enrutador perfecto que sepa cuándo quedarse con el modelo económico puede superar el nivel de referencia de "escalar siempre" por aproximadamente 4.2 puntos en la métrica de costo elegida. Esta brecha muestra que el techo de rendimiento del modelo costoso es más bajo de lo que se presumía.

Diseñando mejores señales de enrutamiento

Los hallazgos sugieren tres direcciones prácticas:

  • Incluir señales en el momento de la generación. Alimentar al enrutador con la salida intermedia del modelo económico (su borrador) captura la dificultad que el prompt por sí solo oculta.
  • Priorizar características superficiales específicas de la tarea. Las métricas simples (como la longitud, la presencia de ciertos operadores o marcadores de estilo de código) pueden ser más predictivas que los embeddings semánticos genéricos.
  • Medir el éxito con métricas conscientes del costo. En lugar de la precisión pura o el AUC, evalúe cuántas llamadas costosas se evitan manteniendo los niveles de calidad objetivo.

Conclusión: Un enrutador que solo optimiza la precisión no puede garantizar ahorros de costos; un enrutamiento eficaz requiere evidencia en el momento de la generación y una evaluación consciente del costo.