DeepSeek gab am 14. September 2026 bekannt, dass es sein Large-Language-Modell (LLM) V4-Pro einstellen und jede API-Anfrage an die neuere Version V4.1-Flash weiterleiten wird.
Warum DeepSeek den Stecker bei V4-Pro zieht
V4-Pro war seit der Einführung das Top-Modell von DeepSeek und wurde als universelles LLM mit breitem Wissen vermarktet. Im vergangenen Jahr hat das Unternehmen V4.1-Flash im Vergleich zu V4-Pro bei den Aufgaben getestet, die für seine API-Kunden entscheidend sind: Codegenerierung, Synthese von Terminal-Befehlen und schnelle Antworten auf kurze Prompts. Die Daten zeigen, dass das neuere Modell schneller läuft, pro Anfrage weniger kostet und bei mehreren aufgabenspezifischen Benchmarks besser abschneidet.
Dieser Wandel spiegelt den Marktdruck wider. Cloudbasierte KI-Dienste berechnen mittlerweile Gebühren pro Token oder pro Recheneinheit, und Entwickler suchen nach Wegen, die Betriebskosten zu senken, ohne dabei an Geschwindigkeit einzubüßen. Durch die Umstellung des gesamten Datenverkehrs auf V4.1-Flash kann DeepSeek die teurere Inferenz-Pipeline, die V4-Pro antreibt, abschalten und die Einsparungen an die Nutzer weitergeben.
Performance und Kosten auf einen Blick
| Benchmark | V4.1-Flash | V4-Pro |
|---|---|---|
| Terminal-Bench 2.1 (Codierung & Befehlsgenerierung) | 90,6 | 87,9 |
| Terminal-Bench 4.0 (komplexe mehrstufige Aufgaben) | 31,2 | 12,4 |
| DeepSWE v1.1 (Software-Engineering-Reasoning) | 74,2 | 62,7 |
In jedem Test schneidet V4.1-Flash besser ab, teilweise mit deutlichem Abstand. Laut internen Vergleichen von DeepSeek übertrifft das Modell zudem Claude Opus 5 und GPT-5.6 Sol in denselben auf Codierung fokussierten Benchmarks.
Die Kosten pro typischer Aufgabe zeigen ein ähnliches Muster:
- GLM-5.3-Flash: $0,25
- DeepSeek V4.1-Flash: $0,27
- Moonshot Kimi K3: $2,00
Entwickler können eine vergleichbare Intelligenz für etwa ein Achtel der Kosten erreichen, wenn sie sich für Flash statt für eine größere, teurere Alternative entscheiden.
Der Kompromiss: weniger enzyklopädisches Wissen
Effizienzgewinne gehen mit einem Rückgang beim Abruf von Fakten einher. Beim Fact-Checking-Benchmark SimpleQA-Verified erreicht V4.1-Flash einen Wert von 42,3, während V4-Pro 55,2 erzielte. DeepSeek beschreibt das neuere Modell als „einen besseren Arbeiter, aber eine schwächere Enzyklopädie“. Anwendungen, die stark auf aktuelles Weltwissen angewiesen sind – wie Nachrichten-Zusammenfassungen oder juristische Recherchen – benötigen möglicherweise externe Wissensdatenbanken oder einen Fallback auf ein größeres Modell.
Wie sich die Branche positioniert
DeepSeeks Alles-oder-nichts-Ansatz steht im Gegensatz zu anderen KI-Anbietern:
- Z.ai bietet ein Spektrum an Modellen an, von kompakt bis groß, sodass Kunden Größe und Effizienz pro Projekt abwägen können.
- Moonshot setzt mit seinem Kimi K3-Modell voll auf Größe und nimmt dafür höhere Kosten für die reine Kapazität in Kauf.
- DeepSeek hat jede API-Anfrage auf Flash umgestellt und setzt darauf, dass der Markt Geschwindigkeit und Preis über reine Skalierbarkeit priorisieren wird.
Diese unterschiedlichen Ansätze zeigen, dass sich der Markt noch nicht auf einen einzigen Weg festgelegt hat. Einige Entwickler legen nach wie vor Wert auf die Breite massiver Modelle; andere tauschen diese gegen schnellere, günstigere Antworten ein.
Praktische Ratschläge für Entwickler
- Wählen Sie ein Modell nicht allein nach seinem Namen oder Token-Preis aus. Ein „Flash“-Modell kann bei den für Sie wichtigen Aufgaben ein „Pro“-Modell übertreffen.
- Bauen Sie Flexibilität in Ihren Tech-Stack ein. Gestalten Sie Ihr System so, dass Sie zwischen Anbietern oder Modellversionen wechseln können, ohne umfangreiche Code-Änderungen vornehmen zu müssen.
- Validieren Sie mit Ihren eigenen Daten. Öffentliche Benchmarks bieten eine nützliche Basislinie, aber die Leistung in der Praxis hängt von Ihrer Arbeitslast ab.
Das Befolgen dieser Schritte hilft Teams, einen Vendor Lock-in zu vermeiden und den besten Nutzen zu erzielen, während sich das LLM-Ökosystem weiterentwickelt.
Worauf man als Nächstes achten sollte
Die Einstellung von V4-Pro markiert eine klare Kehrtwende hin zu effizienzorientierten LLMs. Ob dies die Ära der „Flaggschiff-Modelle“ beendet oder lediglich eine neue Phase eines sich schnell verändernden Marktes einleitet, bleibt abzuwarten; aber Entwickler, die agil bleiben, werden am besten positioniert sein, um von diesem Wandel zu profitieren.
