Pandoras AI-Modell-Routing-Box

Ein neues Paper von DeepMind schlägt ein „Pandora’s Box“-Framework vor, das den Routing-Overhead um bis zu 70 % senkt, während die Performance bei den Aufgaben unverändert bleibt.

Warum Routing-Kosten entscheidend sind

Wenn ein Dienst eine Anfrage erhält, verfügt er oft über eine Auswahl an Modellen – einige sind schnell, aber ungenau, andere langsam, aber präzise. Die Auswahl des besten Modells kostet Rechenleistung und Geld. Man muss einen schnellen Test durchführen, externe Daten abrufen oder ein Hilfswerkzeug aufrufen, bevor man weiß, welches Modell am besten passt.

Die Analogie zur Büchse der Pandora

DeepMind überträgt das Routing-Problem auf das klassische Rätsel der Büchse der Pandora: Jedes Modell ist eine versiegelte Box, die seine Leistung bei der aktuellen Abfrage verbirgt. Das Öffnen einer Box verbraucht Ressourcen, daher muss man entscheiden, ob der potenzielle Gewinn die Kosten rechtfertigt. Das Framework formalisiert diesen Kompromiss und bietet zwei konkrete Mechanismen.

Pandora’s Router – ein zentraler Entscheidungsträger

Der Router führt zunächst einen kostengünstigen, ungenauen Schätzer aus, um das Potenzial eines Modells zu ermitteln. Nur wenn die erwartete Verbesserung gegenüber dem derzeit besten Modell einen vordefinierten „Reservierungspreis“ überschreitet, investiert er in eine genauere Bewertung. Indem der Router darauf verzichtet, jedes Modell zu prüfen, reduziert er das Prüfbudget drastisch und findet dennoch die leistungsstärkste Option.

Pandora’s Bidder – ein dezentraler Marktplatz

In der Bidder-Variante entscheidet jeder Modellanbieter selbst, ob er Geld für eine Selbsteinschätzung ausgibt, die ihm einen Auftrag einbringen könnte. Anbieter geben Gebote nur dann ab, wenn sie erwarten, dass die Gewinnchance die Kosten der Bewertung überwiegt. Dies schafft einen Markt, in dem kostspielige Evaluierungen nur dann stattfinden, wenn der Ertrag hoch genug ist.

Ergebnisse in drei Bereichen

Die Autoren testeten beide Mechanismen in folgenden Bereichen:

  • Mathematisches Schlussfolgern – Auswahl des Modells, das ein Problem am genauesten löst.
  • Retrieval-augmented Generation (RAG) – Auswahl des Retrieval-Systems, das den relevantesten Kontext liefert, bevor ein Sprachmodell eine Antwort generiert.
  • Großflächige Embedding-Auswahl – Auswahl des Encoders, der die beste Vektordarstellung für die Ähnlichkeitssuche liefert.

In jedem Fall erzielte Pandora’s Router die niedrigste kombinierte Kosten-plus-Fehler-Metrik und schlug damit Baselines, die entweder jedes Modell prüfen oder gar keines prüfen. Das System passt sich automatisch an: Wenn die Prüfkosten steigen, werden weniger Modelle geprüft; wenn sie sinken, wird die Prüfung intensiviert. Die berichteten Einsparungen liegen zwischen 30 % und 70 % der Routing-Ausgaben, ohne dass die Qualität der nachgelagerten Aufgaben messbar sinkt.

Fazit: Da die Inferenz-Budgets immer weiter ansteigen, wird die Entscheidung, wann man aufhört, nach einem besseren Modell zu suchen, ebenso entscheidend wie die Wahl des Modells selbst. Pandora’s Box verwandelt eine versteckte Ausgabe in einen steuerbaren Hebel.

Quelle: https://dev.to/andrea_schiona/pandoras-ai-model-routing-box-efficient-allocation-with-costly-value-estimation-3c4c