భారీ AI మోడల్‌ను భారీ స్థాయిలో నడపడం అనేది ఒక శాస్త్రీయ విజయానికంటే, విద్యుత్ బిల్లులు మరియు డేటాసెంటర్ అద్దెలకు సంబంధించిన కఠినమైన గణిత సమస్యగా మారింది. Gemini ఉత్పత్తి చేసే ప్రతి టోకెన్ Googleకి ఒక వాస్తవ ఖర్చును కలిగిస్తుంది—సిలికాన్ సైకిల్స్, మెమరీ బ్యాండ్‌విడ్త్ మరియు విద్యుత్ వినియోగం. క్వెరీ వాల్యూమ్ పెరిగేకొద్దీ, సెంటీల వంతు ఖర్చు కూడా లాభాలను పూర్తిగా మింగేసేంత పెద్ద మొత్తంగా మారుతుంది. ఆ నిశ్శబ్ద అత్యవసరత వెనుక Frozen v2 ఉంది, ఇది ప్రస్తుతం Google లో రూపుదిద్దుకుంటున్న ఒక అంతర్గత సర్వర్ చిప్ ప్రాజెక్ట్. తన జనరల్-పర్పస్ Tensor Processing Units (TPUs) ను మరో తరం కోసం మెరుగుపరచడానికి బదులుగా, కంపెనీ మరింత విప్లవాత్మకమైన ప్రయత్నం చేస్తోంది: Gemini మోడల్ యొక్క నిర్మాణాన్ని (skeleton) నేరుగా సిలికాన్‌లోనే రూపొందించడం.

ఫ్లెక్సిబుల్ యాక్సిలరేటర్ల నుండి మోడల్-స్పెసిఫిక్ సిలికాన్ వరకు

Google యొక్క TPUs దాదాపు దశాబ్ద కాలంగా దాని ఇన్‌ఫ్రాస్ట్రక్చర్‌కు వెన్నెముకగా ఉన్నాయి. ఇవి మోడళ్లను ట్రైన్ చేస్తాయి, సెర్చ్ ర్యాంకింగ్ అల్గారిథమ్‌లను నడుపుతాయి మరియు Nvidia యొక్క GPUs కి ప్రత్యామ్నాయం కోసం చూస్తున్న Meta వంటి క్లౌడ్ కస్టమర్లకు గంటల ప్రాతిపదికన అద్దెకు కూడా ఇస్తారు. ఆ బహుముఖ ప్రజ్ఞే ఒక TPUని TPUగా చేస్తుంది. ఇది మ్యాట్రిక్స్ మల్టిప్లికేషన్ మరియు మెమరీ మూవ్‌మెంట్ వంటి సాధారణ భాషను ఉపయోగిస్తుంది, దీనిని సాఫ్ట్‌వేర్‌లో మీరు వివరించగల దాదాపు ఏ న్యూరల్ నెట్‌వర్క్‌లోనైనా ఉపయోగించవచ్చు.

Frozen v2 కావాలనే ఆ ఫ్లెక్సిబిలిటీని వదులుకుంటుంది. ఈ చిప్‌ను ఒక డొమైన్-స్పెసిఫిక్ యాక్సిలరేటర్‌గా రూపొందిస్తున్నారు, దీని సర్క్యూట్లు Gemini యొక్క నిర్మాణాన్ని భౌతికంగా ప్రతిబింబిస్తాయి. ఒక TPU సూచనలను (instructions) తీసుకుని వాటిని సాఫ్ట్‌వేర్ ఆపరేషన్లుగా మారుస్తుంది, కానీ Frozen v2 మోడల్ యొక్క స్ట్రక్చరల్ బ్లూప్రింట్—అంటే దాని లేయర్‌ల అమరిక మరియు డేటా పాత్‌లను—నేరుగా చిప్ లేఅవుట్‌లోనే ముద్రవేస్తుంది. మోడల్ మరియు మెటల్ మధ్య ఉండే ఈ విడదీయలేని బంధం వల్ల, AI ప్రతిస్పందనలను అందించడంలో ఈ చిప్ ప్రస్తుత TPUs కంటే ఆరు నుండి పది రెట్లు ఎక్కువ సమర్థవంతంగా పనిచేస్తుందని Google ఆశిస్తోంది. ప్రతి క్వెరీకి తక్కువ కంప్యూట్ స్టెప్స్ ఉండటం వల్ల, టోకెన్ కనిపించడానికి వేచి ఉండే సమయం తగ్గుతుంది మరియు దానిని రూపొందించడానికి తక్కువ శక్తి ఖర్చవుతుంది.

ఇది కేవలం అదే ఆలోచన యొక్క వేగవంతమైన వెర్షన్ మాత్రమే కాదు. ఇది ఒక విభిన్న రకమైన చిప్, ఇది సాధారణ ఉపయోగం కోసం కాకుండా ఒకే మోడల్ ఫ్యామిలీ కోసం ప్రత్యేకంగా రూపొందించబడింది.

మొదటి “Frozen” ఎందుకు కరిగిపోయింది

ఈ విధానం Google DeepMind యొక్క చీఫ్ సైంటిస్ట్ జెఫ్ డీన్ ప్రతిపాదించిన ఒక పాత భావన నుండి పుట్టింది. అసలు “Frozen” ప్రతిపాదన కేవలం ఆర్కిటెక్చర్‌ను మాత్రమే కాకుండా, మోడల్ వెయిట్స్‌ను—Gemini యొక్క నేర్చుకున్న ప్రవర్తనను నిర్ణయించే బిలియన్ల కొద్దీ ట్యూన్డ్ పారామీటర్లు—నేరుగా చిప్‌లోనే హార్డ్‌కోడ్ చేయడం ద్వారా స్పెషలైజేషన్‌ను మరింత ముందుకు తీసుకెళ్లాలని సూచించింది.

దీని వెనుక ఉన్న తర్కం సరైనదే. మోడల్ ఏ నంబర్లను ఉపయోగిస్తుందో మీకు ఖచ్చితంగా తెలిస్తే, వాటిని ఎక్స్‌టర్నల్ మెమరీ నుండి ఎందుకు తీసుకోవాలి? వాటిని ట్రాన్సిస్టర్లలోనే ముద్రించడం ద్వారా ఆలస్యాన్ని (delay) పూర్తిగా తొలగించవచ్చు.

సమస్య ఏమిటంటే శాశ్వతత్వం. AI మోడళ్లు స్థిరంగా ఉండవు. Google నిరంతరం Geminiని అప్‌డేట్ చేస్తూ, కొత్త డేటాతో రీట్రైన్ చేస్తూ, పారామీటర్లను సర్దుబాటు చేస్తూ, మెరుగైన వెర్షన్లను విడుదల చేస్తూ ఉంటుంది. సిలికాన్‌లో వెయిట్స్ ఫ్రీజ్ చేయబడిన చిప్, కొత్త మోడల్ వెర్షన్ విడుదలైన వెంటనే పనికిరాని వస్తువుగా మారిపోతుంది. ఆ ఫ్లెక్సిబిలిటీ లేకపోవడమే అసలు కాన్సెప్ట్‌ను దెబ్బతీసింది.

ఆంకర్ లేని ఆర్కిటెక్చర్

Frozen v2 ఆర్కిటెక్చర్‌ను హార్డ్‌కోడ్ చేస్తూనే, వెయిట్స్‌ను మార్చుకునేలా వదిలివేయడం ద్వారా పాతబడిపోయే ప్రమాదాన్ని పరిష్కరిస్తుంది. దీనిని కారును రోడ్డుకు వెల్డింగ్ చేయడం కంటే, ఒక ప్రత్యేకమైన రేస్ ట్రాక్‌ను నిర్మించడం లాగా భావించవచ్చు. సర్క్యూట్ ఆకారం Gemini యొక్క నిర్దిష్ట కంప్యూటేషన్ ప్యాటర్న్‌ల కోసం స్థిరంగా ఉంటుంది, కానీ ఆ సర్క్యూట్ల ద్వారా ప్రవహించే కంటెంట్‌ను మెమరీ నుండి కొత్త వెయిట్స్‌ను లోడ్ చేయడం ద్వారా అప్‌డేట్ చేయవచ్చు.

ఈ తేడా ఆచరణలో చాలా ముఖ్యం. ఇంజనీర్లు కొత్త Gemini చెక్‌పాయింట్‌ను ట్రైన్ చేసినప్పుడు, కొత్త చిప్‌ను తయారు చేయకుండానే దానిని Frozen v2 హార్డ్‌వేర్‌కు పంపవచ్చు. ఎంత మేరకు హార్డ్‌కోడ్ చేయాలనేది Google లో ఇంకా చర్చనీయాంశమే; ఏ నిర్మాణ అంశాలు సిలికాన్‌లో శాశ్వతంగా ఉండాలి మరియు ఏవి మార్చుకోగలిగేలా (configurable) ఉండాలి అనేది టీమ్‌లు నిర్ణయించుకోవాలి. కానీ దీని సూత్రం మాత్రం తేటగా ఉంది. ఆకారాన్ని స్థిరంగా ఉంచుతూ, పారామీటర్లను సులభంగా మార్చడం ద్వారా, Google తన పనితీరును మెరుగుపరిచే సామర్థ్యాన్ని కోల్పోకుండానే అత్యధిక సామర్థ్యాన్ని పొందుతోంది.

ఇన్‌హౌస్‌లోనే ఉంచుకోవడం వెనుక ఉన్న ఆర్థిక అంశాలు

Frozen v2 ని Google Cloud ధరల జాబితాలో మీరు చూడకపోవడానికి మరొక కారణం ఉంది. ఈ చిప్ Gemini యొక్క అంతర్గత నిర్మాణానికి అనుగుణంగా రూపొందించబడినందున, PyTorch లేదా కస్టమ్ Transformer వెర్షన్లను ఉపయోగించే బయటి డెవలపర్లకు ఇది పెద్దగా ఉపయోగపడదు. దీనిని జనరల్-పర్పస్ ప్రొడక్ట్‌గా విక్రయించే ప్రణాళిక Google కి లేదు. ఇది Google యొక్క స్వంత డేటాసెంటర్లలోని ఇన్‌ఫరెన్స్ సామర్థ్యం (inference capacity) యొక్క భారీ డిమాండ్‌ను తీర్చడానికి ఉద్దేశించిన ఒక అంతర్గత సాధనంగా మాత్రమే ఉంటుంది.

ఆ ఎంపిక ఒక కఠినమైన ఆర్థిక వాస్తవికతను ప్రతిబింబిస్తుంది. ప్రస్తుత జనరేటివ్ AI మార్కెట్‌లో, మోడల్ సామర్థ్యాలు వేగంగా ఒకే స్థాయికి చేరుకుంటున్నాయి. పోటీదారుల మధ్య తేడా తరచుగా ప్రతి టోకెన్‌కు అతి తక్కువ ఖర్చుతో అతిపెద్ద మోడల్‌ను ఎవరు నడపగలరు అనే అంశంపై ఆధారపడి ఉంటుంది. ఇన్ఫరెన్స్ (Inference) అనేది ఇకపై ట్రైనింగ్ తర్వాత ఆలోచించే విషయం కాదు; Gemini వంటి విస్తృతంగా ఉపయోగించబడే ఉత్పత్తికి, ఇది ప్రధాన ఖర్చు. ఒకవేళ Frozen v2 ఆ ఖర్చును ఆరు రెట్లు లేదా అంతకంటే ఎక్కువ తగ్గించగలిగితే, పోటీదారులు సులభంగా అందుకోలేని అదనపు ప్రయోజనాన్ని Google పొందుతుంది. ఇది ఆ పొదుపును లాభంగా (margin) ఉంచుకోవచ్చు లేదా API వినియోగదారులు మరియు ప్రొడక్ట్ ఇంటిగ్రేషన్ల కోసం తక్కువ ధరలుగా అందించవచ్చు, తద్వారా OpenAI, Anthropic మరియు ఇతరులపై ఒత్తిడిని పెంచవచ్చు.

ఇది పరిశ్రమకు ఇచ్చే సంకేతం

Google యొక్క ఈ చర్య విస్తృతమైన హార్డ్‌వేర్ వ్యూహం ఏ దిశగా వెళ్తుందో కూడా సూచిస్తుంది. సంవత్సరాలుగా, సాధ్యమైనంత వరకు అత్యంత ఫ్లెక్సిబుల్ యాక్సిలరేటర్‌ను నిర్మించి, స్పెషలైజేషన్ కోసం సాఫ్ట్‌వేర్‌ను వదిలేయడమే ప్రామాణిక పద్ధతిగా ఉండేది. Nvidia యొక్క GPUs ప్రాచుర్యం పొందడానికి కారణం, అవి మాలిక్యులర్ డైనమిక్స్ నుండి వీడియో గేమ్స్ మరియు లార్జ్ లాంగ్వేజ్ మోడల్స్ వరకు అన్నింటినీ నడపగలవు. Google యొక్క సొంత TPUs కూడా అదే విస్తృత ప్రయోజనం అనే ఉద్దేశంతో రూపొందించబడ్డాయి.

Frozen v2 ఆ సంప్రదాయాన్ని విచ్ఛిన్నం చేస్తోంది. ఒకే మోడల్ ఫ్యామిలీ తగినంత క్వెరీ వాల్యూమ్‌ను కలిగి ఉన్నప్పుడు, ఆ మోడల్‌కు అనుగుణంగా రూపొందించిన కస్టమ్ సిలికాన్ తన ఖర్చును అనేక రెట్లు వెనక్కి తెచ్చి లాభాలను అందించగలదని ఇది అంగీకరించడమే. ఇతర హైపర్‌స్కేలర్లు కూడా ఇలాంటి లాజిక్‌నే అనుసరించారు—ఉదాహరణకు Amazon యొక్క Trainium మరియు Inferentia చిప్‌లు—కానీ Google యొక్క విధానం సాధారణ నెట్‌వర్క్ క్లాస్ కంటే ఒక నిర్దిష్ట మోడల్ ఆర్కిటెక్చర్ చుట్టూ హార్డ్‌వేర్‌ను కో-డిజైన్ చేయడం ద్వారా మరింత లోతుగా వెళ్తుంది.

అయితే, ఇందులో ఉన్న రిస్క్ ఏమిటంటే వశ్యత లేకపోవడం (rigidity). ఒకవేళ Gemini ఆర్కిటెక్చర్ హార్డ్‌కోడ్ చేయబడిన సర్క్యూట్‌లు తట్టుకోలేనంత కొత్త దిశలో మారుతుంటే, Google తన కొత్త ఆలోచనలను నడపలేని ఖరీదైన సిలికాన్‌తో ఇబ్బంది పడవచ్చు. అందుకే ఆర్కిటెక్చర్-ఓన్లీ (architecture-only) రాజీ ముఖ్యం. ఇది ఒక మధ్యేమార్గం: అద్భుతమైన సామర్థ్య లాభాలను పొందడానికి తగినంత స్పెషలైజేషన్, మరియు కంపెనీని ఇబ్బందుల్లోకి నెట్టకుండా ఉండటానికి తగినంత ఫ్లెక్సిబిలిటీని ఇది అందిస్తుంది.

అసలైన సారాంశం

Frozen v2ని కేవలం ఒక చిప్ ప్రకటనగా కాకుండా, AI పోటీ యొక్క భవిష్యత్తు రూపంపై వేసిన వ్యూహాత్మక పందెంగా అర్థం చేసుకోవడం ఉత్తమం. విజేతలు కేవలం ఉత్తమ మోడల్‌లను నిర్మించడమే కాకుండా, మోడల్ బ్లూప్రింట్ నుండి ట్రాన్సిస్టర్ ద్వారా ప్రవహించే ఎలక్ట్రాన్ల వరకు మొత్తం స్టాక్‌ను (entire stack) తమ ఆధీనంలో ఉంచుకుంటారని Google పందెం వేస్తోంది. ఈ ప్రాజెక్ట్ విజయవంతమైతే, దాని ఫలితం బెంచ్‌మార్క్ స్కోర్‌లలో కనిపించదు. అది త్రైమాసిక ఆదాయ నివేదికలోని ఖర్చు కాలమ్‌లో కనిపిస్తుంది, అక్కడ ప్రతి మిలియన్ టోకెన్‌కు కొన్ని సెంట్లు ఆదా చేయడం ద్వారా జనరేటివ్ AIలో వాణిజ్యపరంగా సాధ్యమయ్యే అంశాల సరిహద్దులను మళ్ళీ మార్చవచ్చు.