La caja de enrutamiento de modelos de IA de Pandora

El nuevo artículo de DeepMind propone un marco de trabajo llamado “Pandora’s Box” que reduce la sobrecarga de enrutamiento hasta en un 70 %, manteniendo el rendimiento de las tareas sin cambios.

Por qué importan los costes de enrutamiento

Cuando un servicio recibe una solicitud, a menudo dispone de un menú de modelos: algunos rápidos pero imprecisos, otros lentos pero precisos. Elegir el mejor tiene un coste en computación y dinero. Es necesario realizar una prueba rápida, obtener datos externos o llamar a una herramienta auxiliar antes de saber qué modelo es el adecuado.

La analogía de la caja de Pandora

DeepMind mapea el problema de enrutamiento al clásico acertijo de la caja de Pandora: cada modelo es una caja sellada que oculta su rendimiento ante la consulta actual. Abrir una caja consume recursos, por lo que se debe decidir si la ganancia potencial justifica el gasto. El marco de trabajo formaliza este compromiso y proporciona dos mecanismos concretos.

Pandora’s Router: un tomador de decisiones centralizado

El enrutador primero ejecuta un estimador económico y con ruido para evaluar la promesa de un modelo. Solo si la mejora esperada respecto al mejor actual supera un "precio de reserva" preestablecido, se paga por una evaluación más precisa. Al negarse a inspeccionar cada modelo, el enrutador reduce drásticamente el presupuesto de inspección y, aun así, logra identificar la opción de mejor rendimiento.

Pandora’s Bidder: un mercado descentralizado

En la variante del postor (bidder), cada proveedor de modelos decide si gasta dinero en una autoevaluación que podría hacerle ganar un contrato. Los proveedores presentan ofertas solo cuando esperan que la probabilidad de ganar compense el coste de la evaluación. Esto crea un mercado en el que las evaluaciones costosas solo ocurren cuando la recompensa es lo suficientemente alta.

Resultados en tres dominios

Los autores probaron ambos mecanismos en:

  • Razonamiento matemático – seleccionar el modelo que resuelve un problema con mayor precisión.
  • Generación aumentada por recuperación (RAG) – elegir el sistema de recuperación que proporcione el contexto más relevante antes de que un modelo de lenguaje genere una respuesta.
  • Selección de embeddings a gran escala – elegir el codificador que produzca la mejor representación vectorial para la búsqueda de similitud.

En todos los casos, Pandora’s Router registró la métrica combinada de coste más error más baja, superando a los modelos de referencia que siempre inspeccionan cada modelo o que nunca inspeccionan ninguno. El sistema se adapta automáticamente: cuando los costes de inspección aumentan, inspecciona menos modelos; cuando bajan, intensifica el escrutinio. Los ahorros reportados oscilan entre el 30 % y el 70 % de los gastos de enrutamiento, sin una caída mensurable en la calidad de las tareas posteriores.

Conclusión: A medida que los presupuestos de inferencia se disparan, decidir cuándo dejar de buscar un modelo mejor se vuelve tan crucial como elegir el modelo en sí. Pandora’s Box convierte un gasto oculto en una palanca controlable.

Fuente: https://dev.to/andrea_schiona/pandoras-ai-model-routing-box-efficient-allocation-with-costly-value-estimation-3c4c