Vercels Tokenanteils-Bericht für Juni zeigt, dass Open-Weight-Modelle 29 % der Gateway-Token verarbeiten – ein Anstieg von 11 % im April, wobei DeepSeek allein 22,6 % dieses Volumens ausmacht. Dieser Sprung signalisiert einen schnellen Wandel: Entwickler lösen sich von einem einzelnen „besten“ Modell und behandeln KI-Modelle zunehmend als routierbare Infrastruktur.

Warum Entwickler Modelle als Infrastruktur behandeln

Günstige Open-Weight-Modelle – viele von chinesischen Anbietern – kosten nur einen Bruchteil von Premium-Angeboten wie Anthropic. Für Routineaufgaben wie Code-Extraktion, Textbereinigung oder einfache Datenabfragen kann ein Modell, das Cent statt Dollar kostet, attraktiver sein, selbst wenn es um einige Prozentpunkte weniger genau ist.

Das Ergebnis ist ein neues Entwurfsmuster. Eine Anwendung sendet eine Anfrage zuerst an ein kostengünstiges Modell für den „langweiligen“ Teil der Arbeit. Wenn die Ausgabe eine einfache Qualitätsprüfung besteht, wird die Pipeline fortgesetzt; wenn nicht, wird ein teureres Modell für einen zweiten Durchlauf oder eine endgültige Entscheidung aufgerufen. Die Routing-Logik wird zum entscheidenden Element, nicht die Wahl eines einzelnen Modells.

Was die Zahlen sagen

Vercels Daten, die aus seinem Gateway stammen, das mehrere KI-Anbieter bündelt, zeigen, dass Open-Weight-Modelle von der Peripherie in den Mainstream rücken. Im April machten sie etwas mehr als ein Zehntel aller Token aus; bis Juni waren es fast ein Drittel. DeepSeek, ein chinesisches Modell, trug allein mehr als ein Fünftel des Token-Volumens bei.

High-End-Modelle dominieren jedoch weiterhin die Ausgaben. Anthropic beispielsweise sichert sich weiterhin den Großteil der finanziellen Aufwendungen, da der Preis pro Token höher ist. Die Logik ist simpel: Günstige Modelle gewinnen die Arbeiten mit hohem Volumen und geringer Marge, während teure Modelle die Aufgaben mit hoher Marge und hoher Wirkung behalten.

Auswirkungen auf KI-Agenten

Ein KI-Agent führt typischerweise eine Sequenz von Schritten aus: Planung, Datenabruf, Tool-Aufruf und Ergebnisverfeinerung. Wenn jeder Schritt dem kosteneffizientesten Modell zugewiesen werden kann, sinken die gesamten Betriebskosten drastisch.

  • Datenabruf und Extraktion benötigen oft nur ein grundlegendes Sprachverständnis – eine Aufgabe, in der günstige Modelle glänzen.
  • Die abschließende Beurteilung – der Teil, der entscheidet, ob die Antwort akzeptabel ist – bleibt das Domäne von Premium-Modellen, die eine höhere Zuverlässigkeit bieten.

Dieser geschichtete Ansatz ermöglicht es Entwicklern, größere Arbeitslasten zu automatisieren, ohne die Budgets zu sprengen. Er erzwingt zudem einen Wandel von „Wähle das beste Modell“ hin zu „Messe den Erfolg pro Schritt und route entsprechend“.

Risiken und Grenzen

Die wirtschaftlichen Argumente sind überzeugend, aber der Übergang verläuft nicht reibungslos.

  • Compliance: Einige Rechtsräume legen strenge Regeln für die Datenverarbeitung fest, die die Nutzung im Ausland gehosteter Modelle einschränken können.
  • Komplexität beim Hosting: Große Premium-Modelle sind schwierig intern zu betreiben, sodass Organisationen auf externe APIs angewiesen sind, was Bedenken hinsichtlich Latenz und Vendor Lock-in aufwerfen kann.

Aufgrund dieser Faktoren werden günstige Modelle die Premium-Modelle wahrscheinlich nicht vollständig ersetzen. Stattdessen werden sie zum Standard für Routinearbeiten, während Premium-Modelle in der „Entscheidungsebene“ verbleiben, in der ihre höheren Kosten gerechtfertigt sind.

Worauf man als Nächstes achten sollte

  • Tooling für das Routing: Da die Routing-Schicht immer zentraler wird, können wir eine Welle von SDKs und Plattformen erwarten, die die Modellauswahl basierend auf Latenz, Kosten und Konfidenzschwellen automatisieren.

Entwickler, die damit beginnen, den Erfolg auf Aufgabenebene zu messen, Retries zu verfolgen und „Volumen“ klar von „Beurteilung“ zu trennen, werden am besten positioniert sein, um vom aufkommenden Infrastruktur-Mindset zu profitieren.

Fazit: Der KI-Stack wandelt sich von der Wahl eines einzelnen Modells hin zu einem Routing-Problem, bei dem günstige Open-Weight-Modelle den Großteil der Arbeit erledigen und Premium-Modelle für Entscheidungen mit hoher Tragweite reserviert sind. Das Beherrschen dieses Routings wird der nächste Wettbewerbsvorteil für KI-Entwickler sein.