Das Betreiben eines großen KI-Modells in großem Maßstab ist weniger eine wissenschaftliche Leistung als vielmehr ein brutales mathematisches Problem über Stromrechnungen und Rechenzentrumsmieten. Jedes Token, das Gemini generiert, kostet Google etwas Reales – Silizium-Zyklen, Speicherbandbreite und Watt, die aus der Steckdose gezogen werden. Mit steigendem Abfragevolumen summieren sich Bruchteile eines Cents zu Beträgen auf, die Margen komplett verschlingen können. Diese stille Dringlichkeit steckt hinter Frozen v2, einem internen Server-Chip-Projekt, das sich derzeit bei Google Gestalt annimmt. Anstatt seine universell einsetzbaren Tensor Processing Units für eine weitere Generation zu verfeinern, versucht das Unternehmen etwas weitaus Radikaleres: das Skelett des Gemini-Modells direkt in das Silizium selbst zu gießen.
Von flexiblen Beschleunigern zu modellspezifischem Silizium
Googles TPUs sind seit fast einem Jahrzehnt die Arbeitspferde seiner Infrastruktur. Sie trainieren Modelle, treiben Suchranking-Algorithmen an und werden sogar stundenweise an Cloud-Kunden wie Meta und andere vermietet, die nach einer Alternative zu Nvidias GPUs suchen. Genau diese Vielseitigkeit macht eine TPU zu einer TPU. Sie spricht eine allgemeine Sprache der Matrixmultiplikation und Speicherbewegung, die von fast jedem neuronalen Netzwerk genutzt werden kann, das man in Software beschreiben kann.
Frozen v2 verzichtet bewusst auf diese Flexibilität. Der Chip wird als domänenspezifischer Beschleuniger konzipiert, dessen Schaltkreise Teile der eigenen Architektur von Gemini physisch widerspiegeln. Während eine TPU Befehle abruft und sie als Softwareoperationen interpretiert, würde Frozen v2 den strukturellen Bauplan des Modells – die Anordnung seiner Schichten und Datenpfade – direkt in das Layout des Chips einbrennen. Google erwartet, dass diese enge Verbindung von Modell und Metall den Chip bei der Bereitstellung von KI-Antworten sechs- bis zehnmal effizienter macht als aktuelle TPUs. Weniger Rechenschritte pro Abfrage bedeuten weniger Wartezeit, bis ein Token erscheint, und weitaus weniger Energieaufwand für dessen Generierung.
Dies ist nicht bloß eine schnellere Version derselben Idee. Es handelt sich um eine andere Chip-Kategorie, die Allgemeingültigkeit gegen die Hingabe an eine einzige Modellfamilie eintauscht.
Warum das erste „Frozen“ schmolz
Dieser Ansatz hat seine Wurzeln in einem früheren Konzept, das Jeff Dean, Chief Scientist bei Google DeepMind, zugeschrieben wird. Der ursprüngliche „Frozen“-Vorschlag sah vor, die Spezialisierung noch weiter voranzutreiben, indem nicht nur die Architektur, sondern auch die eigentlichen Modellgewichte – die Milliarden fein abgestimmter Parameter, die das gelernte Verhalten von Gemini ausmachen – direkt in den Chip selbst fest codiert werden.
Die Logik war schlüssig. Wenn man genau weiß, welche Zahlen das Modell verwenden wird, warum sollte man sie dann mühsam aus einem externen Speicher abrufen? Man könnte sie in die Transistoren einätzen und ganze Kategorien von Verzögerungen eliminieren.
Das Problem war die Beständigkeit. KI-Modelle stehen nicht still. Google aktualisiert Gemini kontinuierlich, trainiert es mit neuen Daten neu, passt Parameter an und veröffentlicht verbesserte Versionen. Ein Chip mit im Silizium eingefrorenen Gewichten würde in dem Moment zu einem Briefbeschwerer werden, in dem eine neue Modellrevision erscheint. Dieser Mangel an Flexibilität machte das ursprüngliche Konzept zunichte.
Architektur ohne Anker
Frozen v2 löst die Falle der Veralterung, indem die Architektur fest codiert wird, während die Gewichte veränderbar bleiben. Man kann es sich so vorstellen, als würde man eine maßgeschneiderte Rennstrecke gießen, anstatt das Auto an die Straße zu schweißen. Die Form des Schaltkreises bleibt fixiert und auf die spezifischen Rechenmuster von Gemini optimiert, aber der Inhalt, der durch diese Schaltkreise fließt, kann durch das Laden neuer Gewichte aus dem Speicher erneuert werden.
Diese Unterscheidung ist in der Praxis entscheidend. Wenn Ingenieure einen neuen Gemini-Checkpoint trainieren, können sie diesen auf Frozen-v2-Hardware bereitstellen, ohne einen neuen Chip fertigen zu müssen. Der genaue Grad der Festcodierung ist innerhalb von Google noch eine offene Frage; die Teams müssen entscheiden, welche strukturellen Elemente „Silizium-Unsterblichkeit“ verdienen und welche konfigurierbar bleiben sollten. Aber das Prinzip steht fest. Indem Google die Form einfriert und die Parameter flüssig austauscht, behält das Unternehmen die Effizienzvorteile bei, ohne die Fähigkeit zur Iteration zu opfern.
Die Ökonomie der Eigenentwicklung
Es gibt noch einen weiteren Grund, warum Frozen v2 nicht in der Preisliste von Google Cloud zu finden sein wird. Da der Chip so eng auf die internen Strukturen von Gemini zugeschnitten ist, ergäbe er für externe Entwickler, die PyTorch oder eigene Transformer-Varianten nutzen, wenig Sinn. Google hat nicht vor, ihn als universelles Produkt zu verkaufen. Er wird ein internes Werkzeug bleiben, das gezielt auf den enormen Bedarf an Inferenzkapazitäten in Googles eigenen Rechenzentren ausgerichtet ist.
That choice reflects a blunt economic reality. In the current generative AI market, model capabilities are converging quickly. The gap between competitors often comes down to who can afford to run the largest model at the lowest cost per token. Inference is no longer an afterthought to training; for a widely used product like Gemini, it is the dominant expense. If Frozen v2 cuts that expense by a factor of six or more, Google gains headroom that competitors cannot easily match. It can either pocket the savings as margin or pass them along as lower prices for API consumers and product integrations, tightening the screws on OpenAI, Anthropic, and others.
What This Signals for the Industry
Google’s move also hints at where the broader hardware strategy is heading. For years, the standard playbook was to build the most flexible accelerator possible and let software handle the specialization. Nvidia’s GPUs dominate because they run everything from molecular dynamics to video games to large language models. Google’s own TPUs were conceived in that same spirit of broad utility.
Frozen v2 breaks from that tradition. It is an admission that when a single model family drives enough query volume, custom silicon tailored to that model can pay for itself many times over. Other hyperscalers have pursued similar logic—Amazon’s Trainium and Inferentia chips, for instance—but Google’s approach goes deeper by co-designing hardware around a specific model architecture rather than a general class of networks.
The risk, of course, is rigidity. If Gemini’s architecture evolves in a direction that the hardcoded circuits cannot accommodate, Google could find itself with expensive silicon that cannot run its newest ideas. That is precisely why the architecture-only compromise matters. It offers a middle path: enough specialization to capture dramatic efficiency gains, enough flexibility to avoid painting the company into a corner.
The Real Takeaway
Frozen v2 is best understood not as a chip announcement, but as a strategic bet on the future shape of AI competition. Google is wagering that the winners will not merely build the best models, but will own the entire stack—from the model’s blueprint down to the electrons pushing through the transistor. If the project succeeds, the payoff will not show up in benchmark scores. It will show up in the cost column of a quarterly earnings report, where a few cents saved per million tokens can redraw the boundaries of what is commercially possible in generative AI.
