ஒரு பெரிய AI மாதிரியைப் பெரிய அளவில் இயக்குவது என்பது ஒரு அறிவியல் சாதனையை விட, மின்சாரக் கட்டணம் மற்றும் தரவு மைய (datacenter) வாடகை குறித்த ஒரு கடுமையான கணிதப் பிரச்சனையாக மாறிவிட்டது. Gemini உருவாக்கும் ஒவ்வொரு டோக்கனும் (token) கூகுளுக்கு ஒரு உண்மையான செலவை ஏற்படுத்துகிறது—சிலிக்கான் சுழற்சிகள் (silicon cycles), மெமரி பேண்ட்வித் (memory bandwidth) மற்றும் மின்சாரப் பயன்பாடு (watts). தேடல் அளவு (query volume) அதிகரிக்கும் போது, ஒரு சதம் என்பதன் ஒரு சிறு பகுதியும் சேர்ந்து, லாப வரம்பையே முழுமையாக விழுங்கிவிடும் அளவிற்குப் பெரிய தொகையாக மாறுகிறது. அந்த அமைதியான அவசரமே கூகுளுக்குள் தற்போது வடிவம் பெற்று வரும் ஒரு உள்நாட்டு சர்வர் சிப் திட்டமான Frozen v2-க்கு பின்னால் உள்ளது. தனது பொதுப் பயன்பாட்டு Tensor Processing Units-களை அடுத்த தலைமுறைக்காக மேம்படுத்துவதற்குப் பதிலாக, நிறுவனம் மிகவும் தீவிரமான ஒன்றைச் செய்ய முயற்சிக்கிறது: Gemini மாதிரியின் கட்டமைப்பை (skeleton) நேரடியாக சிலிக்கானிலேயே வாரியெடுப்பது (casting).

நெகிழ்வான முடுக்கிகளிலிருந்து (Accelerators) மாதிரி சார்ந்த சிலிக்கான் வரை

கூகுளின் TPUs கிட்டத்தட்ட ஒரு தசாப்தமாக அதன் உள்கட்டமைப்பின் முதுகெலும்பாக இருந்து வருகின்றன. அவை மாதிரிகளைப் பயிற்றுவிக்கின்றன, தேடல் தரவரிசை அல்காரிதம்களுக்கு (search ranking algorithms) ஆற்றல் அளிக்கின்றன, மேலும் Meta மற்றும் Nvidia-வின் GPUs-களுக்கு மாற்றைத் தேடும் பிற வாடிக்கையாளர்களுக்கு மணிநேர அடிப்படையில் வாடகைக்கும் வழங்கப்படுகின்றன. அந்தப் பன்முகத்தன்மையே ஒரு TPU-வை TPU-வாக மாற்றுகிறது. இது மேட்ரிக்ஸ் பெருக்கல் (matrix multiplication) மற்றும் மெமரி நகர்வு (memory movement) போன்ற பொதுவான மொழியைப் பேசுகிறது, இதை மென்பொருளில் நீங்கள் விவரிக்கும் கிட்டத்தட்ட எந்த நரம்பியல் வலைப்பின்னலிலும் (neural network) பயன்படுத்தலாம்.

Frozen v2 வேண்டுமென்றே அந்த நெகிழ்வுத்தன்மையைக் கைவிடுகிறது. இந்த சிப் ஒரு குறிப்பிட்ட துறை சார்ந்த முடுக்கியாக (domain-specific accelerator) வடிவமைக்கப்படுகிறது, இதன் சுற்றுகள் (circuits) Gemini-யின் கட்டமைப்பின் ஒரு பகுதிகளைப் பிரதிபலிக்கின்றன. ஒரு TPU கட்டளைகளைப் பெற்று அவற்றை மென்பொருள் செயல்பாடுகளாக விளக்கும் நிலையில், Frozen v2 மாதிரியின் கட்டமைப்பு வரைபடத்தை—அதாவது அதன் அடுக்குகளின் (layers) அமைப்பு மற்றும் தரவுப் பாதைகளை (data paths)—நேரடியாக சிப்பின் வடிவமைப்பிலேயே பதிவிடும். மாதிரி மற்றும் உலோகத்தின் (model and metal) இந்த நெருக்கமான இணைப்பானது, AI பதில்களை வழங்குவதில் தற்போதைய TPUs-களை விட ஆறு முதல் பத்து மடங்கு அதிக செயல்திறனை இந்த சிப்பிற்கு வழங்கும் என்று கூகுள் எதிர்பார்க்கிறது. ஒரு தேடலுக்குக் குறைவான கணக்கீட்டுப் படிகள் (compute steps) என்பது, ஒரு டோக்கன் தோன்றுவதற்கு காத்திருக்கும் நேரத்தைக் குறைப்பதையும், அதை உருவாக்கத் தேவைப்படும் ஆற்றலை வெகுவாகக் குறைப்பதையும் குறிக்கிறது.

இது ஒரே யோசனையின் வேகமான பதிப்பு மட்டுமல்ல. இது ஒரு மாறுபட்ட வகை சிப், இது பொதுவான பயன்பாட்டிற்குப் பதிலாக ஒரு குறிப்பிட்ட மாதிரி குடும்பத்திற்காகவே அர்ப்பணிக்கப்பட்டுள்ளது.

முதல் “Frozen” ஏன் உருகிப்போனது?

இந்த அணுகுமுறை Google DeepMind-ன் தலைமை விஞ்ஞானி ஜெஃப் டீன் (Jeff Dean) முன்மொழிந்த ஒரு முந்தைய கருத்தில் வேரூன்றியுள்ளது. அசல் “Frozen” முன்மொழிவு, கட்டமைப்பை மட்டுமல்லாமல், மாதிரியின் எடைகளையும் (model weights)—அதாவது Gemini-யின் கற்றல் நடத்தையைத் தீர்மானிக்கும் பில்லியன் கணக்கான அளவுருக்களை (parameters)—நேரடியாக சிப்பிலேயே 'ஹார்ட்கோடிங்' (hardcoding) செய்வதன் மூலம் சிறப்பம்சத்தை இன்னும் அதிகப்படுத்தப் பரிந்துரைத்தது.

அந்தத் தர்க்கம் சரியானதுதான். மாதிரி எந்த எண்களைப் பயன்படுத்தும் என்பதை நீங்கள் துல்லியமாக அறிந்தால், அவற்றை வெளிப்புற மெமரியிலிருந்து ஏன் எடுக்க வேண்டும்? அவற்றை டிரான்சிஸ்டர்களிலேயே (transistors) செதுக்கிவிடலாம், இதன் மூலம் தாமதத்தின் முழு வகைகளையும் தவிர்க்கலாம்.

பிரச்சனை அதன் நிரந்தரத்தன்மைதான். AI மாதிரிகள் நிலையானவை அல்ல. கூகுள் Gemini-யைத் தொடர்ந்து புதுப்பித்து வருகிறது, புதிய தரவுகளில் மீண்டும் பயிற்றுவிக்கிறது, அளவுருக்களைச் சரிசெய்கிறது மற்றும் மேம்படுத்தப்பட்ட பதிப்புகளை வெளியிடுகிறது. சிலிக்கானில் எடைகள் உறைந்துபோன (frozen) ஒரு சிப், ஒரு புதிய மாதிரி பதிப்பு வெளியான அடுத்த கணமே பயனற்றதாகிவிடும். அந்த நெகிழ்வுத்தன்மை இல்லாமை அசல் கருத்தை அழித்துவிட்டது.

நங்கூரமில்லாத கட்டமைப்பு

Frozen v2 கட்டமைப்பை மட்டும் ஹார்ட்கோடிங் செய்து, எடைகளை மாற்றியமைக்க அனுமதிப்பதன் மூலம் காலாவதியாகும் சிக்கலைத் தீர்க்கிறது. காரை சாலைடன் வெல்டிங் செய்வதற்குப் பதிலாக, ஒரு பிரத்யேக பந்தயப் பாதையை (racetrack) அமைப்பதைப் போல இதை நினைத்துக் கொள்ளலாம். சுற்றின் வடிவம் Gemini-யின் குறிப்பிட்ட கணக்கீட்டு முறைகளுக்கு ஏற்ப நிலையாக இருக்கும், ஆனால் அந்தச் சுற்றுகள் வழியாகப் பாயும் உள்ளடக்கங்களை மெமரியிலிருந்து புதிய எடைகளை ஏற்றுவதன் மூலம் புதுப்பிக்க முடியும்.

நடைமுறையில் இந்த வேறுபாடு முக்கியமானது. பொறியாளர்கள் ஒரு புதிய Gemini checkpoint-ஐப் பயிற்றுவிக்கும் போது, புதிய சிப்பைத் தயாரிக்காமலேயே அதை Frozen v2 வன்பொருளில் (hardware) பயன்படுத்த முடியும். எந்த அளவிற்கு ஹார்ட்கோடிங் செய்ய வேண்டும் என்பது கூகுளுக்குள் இன்னும் விவாதிக்கப்பட வேண்டிய கேள்வியாகவே உள்ளது; எந்தக் கட்டமைப்பு கூறுகள் சிலிக்கான் அழியாமையைப் பெற வேண்டும் மற்றும் எவை மாற்றியமைக்கக்கூடியதாக (configurable) இருக்க வேண்டும் என்பதைத் टीमें துல்லியமாகத் தீர்மானிக்க வேண்டும். ஆனால் அதன் கொள்கை உறுதி செய்யப்பட்டுவிட்டது. வடிவத்தை நிலைநிறுத்தி, அளவுருக்களைத் தடையின்றி மாற்றுவதன் மூலம், கூகுள் மீண்டும் மீண்டும் மேம்படுத்தும் (iterate) திறனை இழக்காமல், அதன் செயல்திறன் நன்மையைப் பெறுகிறது.

உள்நாட்டிலேயே வைத்திருப்பதன் பொருளாதாரம்

Frozen v2-வை கூகுள் கிளவுட் (Google Cloud) விலைப்பட்டியலில் நீங்கள் காணாததற்கு மற்றொரு காரணமும் உள்ளது. இந்த சிப் Gemini-யின் உள் கட்டமைப்பிற்கு ஏற்ப மிக நெருக்கமாக வடிவமைக்கப்பட்டுள்ளதால், PyTorch அல்லது தனிப்பயனாக்கப்பட்ட Transformer வகைகளைப் பயன்படுத்தும் வெளி டெவலப்பர்களுக்கு இது பெரிய அளவில் பயன்படாது. இதை ஒரு பொதுப் பயன்பாட்டுத் தயாரிப்பாக விற்க கூகுளுக்குத் திட்டம் இல்லை. இது கூகுளின் சொந்த தரவு மையங்களுக்குள் (datacenters) நிலவும் அதீத இன்ஃபரன்ஸ் (inference) தேவையைச் சமாளிப்பதற்கான ஒரு உள்நாட்டுத் கருவியாகவே இருக்கும்.

That choice reflects a blunt economic reality. In the current generative AI market, model capabilities are converging quickly. The gap between competitors often comes down to who can afford to run the largest model at the lowest cost per token. Inference is no longer an afterthought to training; for a widely used product like Gemini, it is the dominant expense. If Frozen v2 cuts that expense by a factor of six or more, Google gains headroom that competitors cannot easily match. It can either pocket the savings as margin or pass them along as lower prices for API consumers and product integrations, tightening the screws on OpenAI, Anthropic, and others.

What This Signals for the Industry

Google’s move also hints at where the broader hardware strategy is heading. For years, the standard playbook was to build the most flexible accelerator possible and let software handle the specialization. Nvidia’s GPUs dominate because they run everything from molecular dynamics to video games to large language models. Google’s own TPUs were conceived in that same spirit of broad utility.

Frozen v2 breaks from that tradition. It is an admission that when a single model family drives enough query volume, custom silicon tailored to that model can pay for itself many times over. Other hyperscalers have pursued similar logic—Amazon’s Trainium and Inferentia chips, for instance—but Google’s approach goes deeper by co-designing hardware around a specific model architecture rather than a general class of networks.

The risk, of course, is rigidity. If Gemini’s architecture evolves in a direction that the hardcoded circuits cannot accommodate, Google could find itself with expensive silicon that cannot run its newest ideas. That is precisely why the architecture-only compromise matters. It offers a middle path: enough specialization to capture dramatic efficiency gains, enough flexibility to avoid painting the company into a corner.

The Real Takeaway

Frozen v2 is best understood not as a chip announcement, but as a strategic bet on the future shape of AI competition. Google is wagering that the winners will not merely build the best models, but will own the entire stack—from the model’s blueprint down to the electrons pushing through the transistor. If the project succeeds, the payoff will not show up in benchmark scores. It will show up in the cost column of a quarterly earnings report, where a few cents saved per million tokens can redraw the boundaries of what is commercially possible in generative AI.