Alibabas Qwen2.5-Max und DeepSeeks V3-Flash kamen diese Woche auf den Markt, wobei jeder einen anderen Weg zu günstigerer KI-Inference einschlägt. Alibaba aktiviert mit seinem 2,4-Billionen-Parameter Mixture-of-Experts (MoE)-Design pro Abfrage nur etwa 95 Milliarden Parameter; DeepSeek reduziert die Architektur, um den Preis pro Token zu senken. Das KI-Wettrüsten wird nun in Dollar pro Token gemessen, nicht mehr nur in der Modellgröße.

Von „mehr Parametern“ zu „weniger Kosten“

Jahrelang war die Parameteranzahl die maßgebliche Kennzahl in der Entwicklung großer Sprachmodelle (LLMs). OpenAI, Google und andere prahlten damit, die Billionen-Parameter-Marke zu knacken, in der Annahme, dass größer gleich klüger bedeute. Alibaba und DeepSeek zeigen, dass sich diese Kalkulation verschoben hat.

Alibabas Qwen2.5-Max setzt weiterhin auf Skalierung, nutzt aber einen kostensparenden Trick. In einem dichten Modell wird bei jeder Inferenz jeder Parameter genutzt, was ein 2,4-Billionen-Parameter-Netzwerk in ein stromfressendes Ungetüm verwandelt. MoE teilt das Netzwerk in viele „Experten“ auf und leitet jede Anfrage an eine Teilmenge weiter. Der Router von Qwen2.5-Max wählt für jeden Prompt etwa 95 Milliarden Parameter aus und liefert so die Denkfähigkeit eines Billionen-Parameter-Systems, während Latenz und Energieverbrauch unter Kontrolle bleiben.

DeepSeek verzichtet gänzlich auf die Ambition der Billionen-Parameter. Sein V3-Flash-Modell ist darauf ausgelegt, günstig, schnell und skalierbar zu sein. Das Unternehmen vermarktet das Modell mit „extrem niedrigen Inference-Preisen“ und zielt auf Entwickler ab, die täglich Millionen von Token verarbeiten, ohne das Budget zu sprengen. Der genaue Preis wird nicht bekannt gegeben, aber die Botschaft ist klar: Wenn ein Startup sich die westlichen Preise pro Token nicht leisten kann, wird V3-Flash zu einer praktikablen Alternative.

Warum Inference-Kosten zu einem Wettbewerbsvorteil werden

Inference-Kosten werden wichtig, wenn Modelle das Labor verlassen und in die Produktion gehen. Unternehmen, die LLMs in Chatbots, Dokumentenanalyse-Pipelines oder Empfehlungsmaschinen integrieren, stellen schnell fest, dass die Preisgestaltung auf Token-Ebene die Betriebskosten dominiert. Ein Modell, das pro Token nur die Hälfte kostet, kann das Budget für andere Initiativen verdoppeln – mehr Daten, höherer Traffic oder zusätzliche Funktionen.

Die beiden chinesischen Firmen zielen auf unterschiedliche Marktsegmente ab. Alibabas MoE verspricht eine hohe Leistung für komplexe, logikintensive Aufgaben, während das Rechenbudget pro Anfrage moderat bleibt. DeepSeeks schlankeres Modell hingegen spricht volumenstarke, latenzsensitive Workloads an, bei denen reine Rechenleistung weniger wichtig ist als kalkulierbare Kosten.

Beide Strategien könnten die Marktanteile westlicher Anbieter untergraben, die große Modelle mit Premium-Preisen bündeln. Wenn Entwickler vergleichbare Ergebnisse zu einem günstigeren Token-Preis erzielen, sinkt der Anreiz, bei teuren APIs zu bleiben.

Bedeutung für das globale KI-Ökosystem

  • Startups und KMU: Niedrigere Inference-Kosten senken die Barriere für KI-gestützte Produkte. Teams, die früher zusätzliches Kapital für API-Rechnungen benötigten, können nun mit knapperen Budgets Prototypen entwickeln und Produkte auf den Markt bringen.
  • Unternehmen: Große Konzerne, die interne KI-Dienste betreiben, können ihre Betriebskosten senken und Mittel für die Datenerfassung, das Fine-Tuning von Modellen oder zusätzliche Rechenleistung freisetzen.
  • Westliche Anbieter: Ihre Erlösmodelle basieren auf Gebühren pro Token. Eine Verschiebung hin zu kostenorientierten Alternativen zwingt sie dazu, die Preise zu senken oder sich über Fähigkeiten zu differenzieren, die günstigere Modelle noch nicht erreichen können.
  • Regulierungsbehörden und politische Entscheidungsträger: Eine erschwinglichere KI könnte die Einführung in verschiedenen Sektoren beschleunigen, was Fragen zu Aufsicht, Datenschutz und dem Tempo der Automatisierung aufwirft.

Abwägungen und Gegenargumente

MoE-Modelle wie Qwen2.5-Max sind kein Selbstläufer. Die Routing-Logik erhöht die technische Komplexität, und eine spärliche Aktivierung (Sparse Activation) kann zu einer ungleichmäßigen Leistung bei verschiedenen Abfragetypen führen. Wenn der Router eine Fehlentscheidung trifft, wird eine Anfrage möglicherweise an suboptimale Experten geleitet, was die Qualität der Ausgabe verschlechtert. Zudem begünstigt die Hardware nach wie vor dichte Berechnungen; spezialisierte Beschleuniger für MoE-Inference sind noch nicht weit verbreitet, was die Effizienzgewinne in der Praxis einschränken könnte.

Auch DeepSeeks Kosten-zuerst-Philosophie birgt Risiken. Aggressive Preisgestaltung bedeutet oft strengere Einschränkungen bei der Modellgröße und den Trainingsdaten, was potenziell die Leistung begrenzt. Für Anwendungen, die nuanciertes logisches Denken erfordern, könnte das günstigere Modell zu kurz greifen und die Nutzer zurück zu größeren, teureren Alternativen treiben.

Schließlich ist „Intelligenz pro Dollar“ nur eine Dimension des Wettbewerbs. Latenz, Zuverlässigkeit, Ökosystem-Unterstützung und die Einhaltung regionaler Vorschriften bleiben entscheidend. Unternehmen, die ein ausgewogenes Paket über all diese Dimensionen hinweg liefern, werden wahrscheinlich dominieren – nicht nur diejenigen, die den Preiskrieg gewinnen.

Worauf man als Nächstes achten sollte

  • Benchmark-Veröffentlichungen: Unabhängige Evaluierungen der MoE-Routing-Effizienz von Qwen2.5-Max und der Token-Kosten von V3-Flash werden zeigen, ob der Hype in messbare Einsparungen umschlägt.
  • Hardware-Entwicklungen: Die Einführung von Beschleunigern, die für spärliche Aktivierung (sparse activation) optimiert sind, könnte die Vorteile von MoE verstärken, während Allzweck-GPUs dichte Modelle (dense models) wettbewerbsfähig halten könnten.
  • Reaktionen auf die Preisgestaltung: Westliche Anbieter könnten ihre Preisstufen anpassen oder kostensparende Funktionen wie Rabatte für Batch-Inferenz oder On-Premise-Lizenzierung hinzufügen.
  • Regulatorische Maßnahmen: Da sich günstigere KI verbreitet, könnten Regierungen Standards für Transparenz und Sicherheit einführen, die beeinflussen könnten, wie diese Modelle in großem Maßstab eingesetzt werden.

Fazit

Alibabas MoE-gestütztes Qwen2.5-Max und DeepSeeks kostengünstiges V3-Flash zeigen, dass das KI-Rennen heute ebenso sehr über Budgettabellen wie über die Parameteranzahl entschieden wird. Unternehmen, die anspruchsvolle Sprachfähigkeiten liefern und gleichzeitig die Kosten pro Token niedrig halten, werden KI einem breiteren Nutzerkreis zugänglich machen und die Wettbewerbsdynamik neu gestalten, die lange Zeit die größten und teuersten Modelle begünstigt hat.