Google hat die letzten Wochen damit verbracht, sein Gemini-Lineup mit einer klaren Botschaft zu ergänzen: Geschwindigkeit und Spezialisierung sind genauso wichtig wie rohe Gewalt. Das Unternehmen hat drei neue Flash-Varianten auf den Markt gebracht, von denen jede auf einen anderen Bereich des Entwicklermarktes zugeschnitten ist. Doch trotz all dieses Schwungs bleibt ein Platz am Tisch leer. Das Flaggschiff Gemini 3.5 Pro fehlt noch immer in der öffentlichen Veröffentlichung, und die Konkurrenz wartet nicht ab.

Gemini 3.6 Flash: Rohe Gewalt gegen Wirtschaftlichkeit eintauschen

Das Herzstück der Ankündigung ist Gemini 3.6 Flash. Google hat dieses Modell so konzipiert, dass es einen Kompromiss eingeht, den viele Entwickler gerne akzeptieren werden. Es opfert die maximale Rohleistung zugunsten dramatischer Verbesserungen bei Geschwindigkeit und Kosten. Für Teams, die autonome Agenten, APIs mit hohem Durchsatz oder groß angelegte Content-Pipelines betreiben, ist dieser Kompromiss oft der Unterschied zwischen einem profitablen Produkt und einem experimentellen.

Die Effizienzgewinne sind konkret. Laut dem Artificial Analysis Index wird erwartet, dass 3.6 Flash etwa 17 Prozent weniger Output-Token verbraucht als sein Vorgänger, 3.5 Flash. In gezielten Benchmarks wie DeepSWE behauptet Google, dass die Token-Einsparungen auf bis zu 65 Prozent steigen können. Wenn man pro Token zahlt und täglich Millionen von Anfragen verarbeitet, schlagen sich diese Prozentsätze direkt im Budget nieder.

Die Preisgestaltung spiegelt diesen Fokus auf Zugänglichkeit wider. Input-Token kosten 1,50 $ pro Million, während Output-Token 7,50 $ pro Million betragen. Ein Kundensupport-Agent oder ein Code-Review-Assistent, der tausende Interaktionen pro Stunde bearbeitet, wird in dieser Stufe weitaus weniger Geld verbrauchen als bei einem Flaggschiff-Modell. Kleinere Startups und Indie-Entwickler haben eine echte Chance, agentische Workflows aufzubauen, ohne ihre Cloud-Credits innerhalb einer Woche aufzubrauchen.

Das Modell ist nicht nur günstiger; es ist auch bei agentischen Aufgaben spürbar intelligenter. Im MLE Bench stiegen die Werte von 49,7 Prozent auf 63,9 Prozent. OSWorld-Verified sprang von 78,4 Prozent auf 83 Prozent. Das sind keine marginalen Gewinne. Sie deuten darauf hin, dass 3.6 Flash mehrstufige Aufgaben mit spürbar größerer Zuverlässigkeit planen, debuggen und ausführen kann als sein Vorgänger. Wenn Sie einen autonomen Forschungsassistenten oder einen Deployment-Agenten entwickeln, zählt diese zusätzliche Kompetenz mehr als die theoretische Spitzenleistung.

Die Spezialisten: Flash-Lite und Flash Cyber

Wenn 3.6 Flash der neue Allrounder ist, zielen die anderen beiden Veröffentlichungen mit chirurgischer Präzision auf spezifische Schwachstellen ab.

Gemini 3.5 Flash-Lite wurde für reine Geschwindigkeit entwickelt. Es generiert 350 Output-Token pro Sekunde und kostet nur 0,30 $ pro Million Input-Token. Diesen Preis kann man schwer ignorieren. Man könnte Echtzeit-Chat-Schnittstellen, Klassifizierungs-Pipelines oder Datenextraktions-Jobs mit hohem Volumen ausführen, ohne dass die Inference-Rechnung die Einnahmen übersteigt.

Was Flash-Lite besonders interessant macht, ist, dass es gelegentlich über sein Gewicht hinaus schlägt. Google stellt fest, dass es das größere Gemini 3 Flash bei bestimmten agentischen Software-Engineering- und Computer-Use-Aufgaben schlägt. Die Branche ist jahrelang davon ausgegangen, dass größer immer besser ist. Flash-Lite stellt diese Vorstellung infrage, indem es beweist, dass ein kleineres, optimiertes Modell einen größeren Generalisten bei spezifischen Aufgaben übertreffen kann. Für Ingenieure, die ein Modell für eine eng gefasste Produktionsaufgabe auswählen, ist diese Optimierungsgeschichte überzeugend.

Dann gibt es noch Gemini 3.5 Flash Cyber. Dies ist kein allgemeiner Chatbot. Es ist ein Sicherheitsspezialist, der direkt in Googles CodeMender-Agent integriert und speziell auf Cybersecurity-Workflows abgestimmt ist. Im CyberGym-Benchmark erreichte es 83,2 Prozent. Das bringt es in Schlagdistanz zu