Het op schaal draaien van een groot AI-model is minder een wetenschappelijke prestatie geworden en meer een brute wiskundige puzzel over elektriciteitsrekeningen en de huur van datacenters. Elke token die Gemini genereert, kost Google iets tastbaars: siliciumcycli, geheugenbandbreedte en watts die uit het stopcontact worden getrokken. Naarmate het zoekvolume groeit, tellen fracties van een cent op tot bedragen die marges volledig kunnen opslokken. Die stille urgentie zit achter Frozen v2, een intern project voor serverchips dat nu vorm krijgt binnen Google. In plaats van de algemene Tensor Processing Units voor een volgende generatie te verfijnen, probeert het bedrijf iets veel radicalers: het skelet van het Gemini-model direct in het silicium zelf te gieten.
Van flexibele versnellers naar modelspecifiek silicium
De TPU's van Google zijn al bijna een decennium de werkpaarden van de infrastructuur. Ze trainen modellen, voeden zoekalgoritmen en worden zelfs per uur verhuurd aan cloudklanten, waaronder Meta en anderen die op zoek zijn naar een alternatief voor de GPU's van Nvidia. Die veelzijdigheid is precies wat een TPU een TPU maakt. Het spreekt een algemene taal van matrixvermenigvuldiging en geheugenverplaatsing, bruikbaar voor bijna elk neuraal netwerk dat je in software kunt beschrijven.
Frozen v2 offert die flexibiliteit doelbewust op. De chip wordt ontworpen als een domeinspecifieke versneller waarvan de circuits fysiek delen van de eigen architectuur van Gemini weerspiegelen. Waar een TPU instructies ophaalt en deze interpreteert als software-operaties, zou Frozen v2 het structurele blauwdruk van het model — de rangschikking van de lagen en datapaden — direct in de lay-out van de chip branden. Google verwacht dat deze nauwe verbintenis tussen model en metaal de chip zes tot tien keer efficiënter maakt dan de huidige TPU's bij het leveren van AI-antwoorden. Minder berekeningsstappen per query betekent minder wachttijd tot een token verschijnt, en veel minder energieverbruik bij het genereren ervan.
Dit is niet simpelweg een snellere versie van hetzelfde idee. Het is een andere categorie chips, een die algemeenheid inruilt voor toewijding aan één specifieke modelfamilie.
Waarom de eerste "Frozen" smolt
Deze aanpak vindt zijn oorsprong in een eerder concept dat wordt toegeschreven aan Jeff Dean, Chief Scientist bij Google DeepMind. Het oorspronkelijke "Frozen"-voorstel suggereerde om specialisatie nog verder door te voeren door niet alleen de architectuur, maar ook de eigenlijke modelgewichten — de miljarden afgestemde parameters die het geleerde gedrag van Gemini vormen — direct in de chip zelf te hardcoden.
De logica was deugdelijk. Als je precies weet welke getallen het model zal gebruiken, waarom zou je ze dan nog uit extern geheugen ophalen? Je zou ze in de transistoren kunnen etsen en zo hele categorieën vertraging kunnen elimineren.
Het probleem was de blijvende aard ervan. AI-modellen staan niet stil. Google werkt Gemini continu bij door te hertrainen op nieuwe gegevens, parameters aan te passen en verbeterde versies uit te brengen. Een chip met gewichten die in silicium zijn vastgelegd, zou het moment dat een nieuwe modelrevisie verschijnt, veranderen in een deurstopper. Dat gebrek aan flexibiliteit maakte een einde aan het oorspronkelijke concept.
Architectuur zonder anker
Frozen v2 lost de valstrik van veroudering op door de architectuur vast te leggen, terwijl de gewichten vrij blijven om te veranderen. Zie het als het gieten van een op maat gemaakt racecircuit in plaats van de auto aan de weg te lassen. De vorm van het circuit blijft vaststaan, geoptimaliseerd voor de specifieke berekeningspatronen van Gemini, maar de inhoud die door die circuits stroomt, kan worden ververst door nieuwe gewichten uit het geheugen te laden.
Dit onderscheid is in de praktijk van groot belang. Wanneer ingenieurs een nieuw Gemini-checkpoint trainen, kunnen ze dit implementeren op Frozen v2-hardware zonder een nieuwe chip te hoeven fabriceren. De exacte mate van hardcoding is binnen Google nog een open vraag; teams moeten precies beslissen welke structurele elementen "silicium-onsterfelijkheid" verdienen en welke configureerbaar moeten blijven. Maar het principe staat vast. Door de vorm te bevriezen en de parameters vloeiend te wisselen, behoudt Google het voordeel van de efficiëntie zonder het vermogen om te itereren op te offeren.
De economie van het in eigen beheer houden
Er is nog een andere reden waarom u Frozen v2 niet op de prijslijst van Google Cloud zult vinden. Omdat de chip zo nauw is afgestemd op de interne werking van Gemini, zou het voor externe ontwikkelaars die PyTorch of aangepaste Transformer-varianten gebruiken, weinig zin hebben. Google heeft geen plannen om het als een algemeen product te verkopen. Het zal een intern hulpmiddel blijven, specifiek gericht op de enorme vraag naar inferentiecapaciteit in de eigen datacenters van Google.
That choice reflects a blunt economic reality. In the current generative AI market, model capabilities are converging quickly. The gap between competitors often comes down to who can afford to run the largest model at the lowest cost per token. Inference is no longer an afterthought to training; for a widely used product like Gemini, it is the dominant expense. If Frozen v2 cuts that expense by a factor of six or more, Google gains headroom that competitors cannot easily match. It can either pocket the savings as margin or pass them along as lower prices for API consumers and product integrations, tightening the screws on OpenAI, Anthropic, and others.
What This Signals for the Industry
Google’s move also hints at where the broader hardware strategy is heading. For years, the standard playbook was to build the most flexible accelerator possible and let software handle the specialization. Nvidia’s GPUs dominate because they run everything from molecular dynamics to video games to large language models. Google’s own TPUs were conceived in that same spirit of broad utility.
Frozen v2 breaks from that tradition. It is an admission that when a single model family drives enough query volume, custom silicon tailored to that model can pay for itself many times over. Other hyperscalers have pursued similar logic—Amazon’s Trainium and Inferentia chips, for instance—but Google’s approach goes deeper by co-designing hardware around a specific model architecture rather than a general class of networks.
The risk, of course, is rigidity. If Gemini’s architecture evolves in a direction that the hardcoded circuits cannot accommodate, Google could find itself with expensive silicon that cannot run its newest ideas. That is precisely why the architecture-only compromise matters. It offers a middle path: enough specialization to capture dramatic efficiency gains, enough flexibility to avoid painting the company into a corner.
The Real Takeaway
Frozen v2 is best understood not as a chip announcement, but as a strategic bet on the future shape of AI competition. Google is wagering that the winners will not merely build the best models, but will own the entire stack—from the model’s blueprint down to the electrons pushing through the transistor. If the project succeeds, the payoff will not show up in benchmark scores. It will show up in the cost column of a quarterly earnings report, where a few cents saved per million tokens can redraw the boundaries of what is commercially possible in generative AI.
