భారీ AI మోడల్ను భారీ స్థాయిలో నడపడం అనేది ఒక శాస్త్రీయ విజయానికంటే, విద్యుత్ బిల్లులు మరియు డేటాసెంటర్ అద్దెలకు సంబంధించిన కఠినమైన గణిత సమస్యగా మారింది. Gemini ఉత్పత్తి చేసే ప్రతి టోకెన్ Googleకి ఒక వాస్తవ ఖర్చును కలిగిస్తుంది—సిలికాన్ సైకిల్స్, మెమరీ బ్యాండ్విడ్త్ మరియు విద్యుత్ వినియోగం. క్వెరీ వాల్యూమ్ పెరిగేకొద్దీ, సెంటీల వంతు ఖర్చు కూడా లాభాలను పూర్తిగా మింగేసేంత పెద్ద మొత్తంగా మారుతుంది. ఆ నిశ్శబ్ద అత్యవసరత వెనుక Frozen v2 ఉంది, ఇది ప్రస్తుతం Google లో రూపుదిద్దుకుంటున్న ఒక అంతర్గత సర్వర్ చిప్ ప్రాజెక్ట్. తన జనరల్-పర్పస్ Tensor Processing Units (TPUs) ను మరో తరం కోసం మెరుగుపరచడానికి బదులుగా, కంపెనీ మరింత విప్లవాత్మకమైన ప్రయత్నం చేస్తోంది: Gemini మోడల్ యొక్క నిర్మాణాన్ని (skeleton) నేరుగా సిలికాన్లోనే రూపొందించడం.
ఫ్లెక్సిబుల్ యాక్సిలరేటర్ల నుండి మోడల్-స్పెసిఫిక్ సిలికాన్ వరకు
Google యొక్క TPUs దాదాపు దశాబ్ద కాలంగా దాని ఇన్ఫ్రాస్ట్రక్చర్కు వెన్నెముకగా ఉన్నాయి. ఇవి మోడళ్లను ట్రైన్ చేస్తాయి, సెర్చ్ ర్యాంకింగ్ అల్గారిథమ్లను నడుపుతాయి మరియు Nvidia యొక్క GPUs కి ప్రత్యామ్నాయం కోసం చూస్తున్న Meta వంటి క్లౌడ్ కస్టమర్లకు గంటల ప్రాతిపదికన అద్దెకు కూడా ఇస్తారు. ఆ బహుముఖ ప్రజ్ఞే ఒక TPUని TPUగా చేస్తుంది. ఇది మ్యాట్రిక్స్ మల్టిప్లికేషన్ మరియు మెమరీ మూవ్మెంట్ వంటి సాధారణ భాషను ఉపయోగిస్తుంది, దీనిని సాఫ్ట్వేర్లో మీరు వివరించగల దాదాపు ఏ న్యూరల్ నెట్వర్క్లోనైనా ఉపయోగించవచ్చు.
Frozen v2 కావాలనే ఆ ఫ్లెక్సిబిలిటీని వదులుకుంటుంది. ఈ చిప్ను ఒక డొమైన్-స్పెసిఫిక్ యాక్సిలరేటర్గా రూపొందిస్తున్నారు, దీని సర్క్యూట్లు Gemini యొక్క నిర్మాణాన్ని భౌతికంగా ప్రతిబింబిస్తాయి. ఒక TPU సూచనలను (instructions) తీసుకుని వాటిని సాఫ్ట్వేర్ ఆపరేషన్లుగా మారుస్తుంది, కానీ Frozen v2 మోడల్ యొక్క స్ట్రక్చరల్ బ్లూప్రింట్—అంటే దాని లేయర్ల అమరిక మరియు డేటా పాత్లను—నేరుగా చిప్ లేఅవుట్లోనే ముద్రవేస్తుంది. మోడల్ మరియు మెటల్ మధ్య ఉండే ఈ విడదీయలేని బంధం వల్ల, AI ప్రతిస్పందనలను అందించడంలో ఈ చిప్ ప్రస్తుత TPUs కంటే ఆరు నుండి పది రెట్లు ఎక్కువ సమర్థవంతంగా పనిచేస్తుందని Google ఆశిస్తోంది. ప్రతి క్వెరీకి తక్కువ కంప్యూట్ స్టెప్స్ ఉండటం వల్ల, టోకెన్ కనిపించడానికి వేచి ఉండే సమయం తగ్గుతుంది మరియు దానిని రూపొందించడానికి తక్కువ శక్తి ఖర్చవుతుంది.
ఇది కేవలం అదే ఆలోచన యొక్క వేగవంతమైన వెర్షన్ మాత్రమే కాదు. ఇది ఒక విభిన్న రకమైన చిప్, ఇది సాధారణ ఉపయోగం కోసం కాకుండా ఒకే మోడల్ ఫ్యామిలీ కోసం ప్రత్యేకంగా రూపొందించబడింది.
మొదటి “Frozen” ఎందుకు కరిగిపోయింది
ఈ విధానం Google DeepMind యొక్క చీఫ్ సైంటిస్ట్ జెఫ్ డీన్ ప్రతిపాదించిన ఒక పాత భావన నుండి పుట్టింది. అసలు “Frozen” ప్రతిపాదన కేవలం ఆర్కిటెక్చర్ను మాత్రమే కాకుండా, మోడల్ వెయిట్స్ను—Gemini యొక్క నేర్చుకున్న ప్రవర్తనను నిర్ణయించే బిలియన్ల కొద్దీ ట్యూన్డ్ పారామీటర్లు—నేరుగా చిప్లోనే హార్డ్కోడ్ చేయడం ద్వారా స్పెషలైజేషన్ను మరింత ముందుకు తీసుకెళ్లాలని సూచించింది.
దీని వెనుక ఉన్న తర్కం సరైనదే. మోడల్ ఏ నంబర్లను ఉపయోగిస్తుందో మీకు ఖచ్చితంగా తెలిస్తే, వాటిని ఎక్స్టర్నల్ మెమరీ నుండి ఎందుకు తీసుకోవాలి? వాటిని ట్రాన్సిస్టర్లలోనే ముద్రించడం ద్వారా ఆలస్యాన్ని (delay) పూర్తిగా తొలగించవచ్చు.
సమస్య ఏమిటంటే శాశ్వతత్వం. AI మోడళ్లు స్థిరంగా ఉండవు. Google నిరంతరం Geminiని అప్డేట్ చేస్తూ, కొత్త డేటాతో రీట్రైన్ చేస్తూ, పారామీటర్లను సర్దుబాటు చేస్తూ, మెరుగైన వెర్షన్లను విడుదల చేస్తూ ఉంటుంది. సిలికాన్లో వెయిట్స్ ఫ్రీజ్ చేయబడిన చిప్, కొత్త మోడల్ వెర్షన్ విడుదలైన వెంటనే పనికిరాని వస్తువుగా మారిపోతుంది. ఆ ఫ్లెక్సిబిలిటీ లేకపోవడమే అసలు కాన్సెప్ట్ను దెబ్బతీసింది.
ఆంకర్ లేని ఆర్కిటెక్చర్
Frozen v2 ఆర్కిటెక్చర్ను హార్డ్కోడ్ చేస్తూనే, వెయిట్స్ను మార్చుకునేలా వదిలివేయడం ద్వారా పాతబడిపోయే ప్రమాదాన్ని పరిష్కరిస్తుంది. దీనిని కారును రోడ్డుకు వెల్డింగ్ చేయడం కంటే, ఒక ప్రత్యేకమైన రేస్ ట్రాక్ను నిర్మించడం లాగా భావించవచ్చు. సర్క్యూట్ ఆకారం Gemini యొక్క నిర్దిష్ట కంప్యూటేషన్ ప్యాటర్న్ల కోసం స్థిరంగా ఉంటుంది, కానీ ఆ సర్క్యూట్ల ద్వారా ప్రవహించే కంటెంట్ను మెమరీ నుండి కొత్త వెయిట్స్ను లోడ్ చేయడం ద్వారా అప్డేట్ చేయవచ్చు.
ఈ తేడా ఆచరణలో చాలా ముఖ్యం. ఇంజనీర్లు కొత్త Gemini చెక్పాయింట్ను ట్రైన్ చేసినప్పుడు, కొత్త చిప్ను తయారు చేయకుండానే దానిని Frozen v2 హార్డ్వేర్కు పంపవచ్చు. ఎంత మేరకు హార్డ్కోడ్ చేయాలనేది Google లో ఇంకా చర్చనీయాంశమే; ఏ నిర్మాణ అంశాలు సిలికాన్లో శాశ్వతంగా ఉండాలి మరియు ఏవి మార్చుకోగలిగేలా (configurable) ఉండాలి అనేది టీమ్లు నిర్ణయించుకోవాలి. కానీ దీని సూత్రం మాత్రం తేటగా ఉంది. ఆకారాన్ని స్థిరంగా ఉంచుతూ, పారామీటర్లను సులభంగా మార్చడం ద్వారా, Google తన పనితీరును మెరుగుపరిచే సామర్థ్యాన్ని కోల్పోకుండానే అత్యధిక సామర్థ్యాన్ని పొందుతోంది.
ఇన్హౌస్లోనే ఉంచుకోవడం వెనుక ఉన్న ఆర్థిక అంశాలు
Frozen v2 ని Google Cloud ధరల జాబితాలో మీరు చూడకపోవడానికి మరొక కారణం ఉంది. ఈ చిప్ Gemini యొక్క అంతర్గత నిర్మాణానికి అనుగుణంగా రూపొందించబడినందున, PyTorch లేదా కస్టమ్ Transformer వెర్షన్లను ఉపయోగించే బయటి డెవలపర్లకు ఇది పెద్దగా ఉపయోగపడదు. దీనిని జనరల్-పర్పస్ ప్రొడక్ట్గా విక్రయించే ప్రణాళిక Google కి లేదు. ఇది Google యొక్క స్వంత డేటాసెంటర్లలోని ఇన్ఫరెన్స్ సామర్థ్యం (inference capacity) యొక్క భారీ డిమాండ్ను తీర్చడానికి ఉద్దేశించిన ఒక అంతర్గత సాధనంగా మాత్రమే ఉంటుంది.
ఆ ఎంపిక ఒక కఠినమైన ఆర్థిక వాస్తవికతను ప్రతిబింబిస్తుంది. ప్రస్తుత జనరేటివ్ AI మార్కెట్లో, మోడల్ సామర్థ్యాలు వేగంగా ఒకే స్థాయికి చేరుకుంటున్నాయి. పోటీదారుల మధ్య తేడా తరచుగా ప్రతి టోకెన్కు అతి తక్కువ ఖర్చుతో అతిపెద్ద మోడల్ను ఎవరు నడపగలరు అనే అంశంపై ఆధారపడి ఉంటుంది. ఇన్ఫరెన్స్ (Inference) అనేది ఇకపై ట్రైనింగ్ తర్వాత ఆలోచించే విషయం కాదు; Gemini వంటి విస్తృతంగా ఉపయోగించబడే ఉత్పత్తికి, ఇది ప్రధాన ఖర్చు. ఒకవేళ Frozen v2 ఆ ఖర్చును ఆరు రెట్లు లేదా అంతకంటే ఎక్కువ తగ్గించగలిగితే, పోటీదారులు సులభంగా అందుకోలేని అదనపు ప్రయోజనాన్ని Google పొందుతుంది. ఇది ఆ పొదుపును లాభంగా (margin) ఉంచుకోవచ్చు లేదా API వినియోగదారులు మరియు ప్రొడక్ట్ ఇంటిగ్రేషన్ల కోసం తక్కువ ధరలుగా అందించవచ్చు, తద్వారా OpenAI, Anthropic మరియు ఇతరులపై ఒత్తిడిని పెంచవచ్చు.
ఇది పరిశ్రమకు ఇచ్చే సంకేతం
Google యొక్క ఈ చర్య విస్తృతమైన హార్డ్వేర్ వ్యూహం ఏ దిశగా వెళ్తుందో కూడా సూచిస్తుంది. సంవత్సరాలుగా, సాధ్యమైనంత వరకు అత్యంత ఫ్లెక్సిబుల్ యాక్సిలరేటర్ను నిర్మించి, స్పెషలైజేషన్ కోసం సాఫ్ట్వేర్ను వదిలేయడమే ప్రామాణిక పద్ధతిగా ఉండేది. Nvidia యొక్క GPUs ప్రాచుర్యం పొందడానికి కారణం, అవి మాలిక్యులర్ డైనమిక్స్ నుండి వీడియో గేమ్స్ మరియు లార్జ్ లాంగ్వేజ్ మోడల్స్ వరకు అన్నింటినీ నడపగలవు. Google యొక్క సొంత TPUs కూడా అదే విస్తృత ప్రయోజనం అనే ఉద్దేశంతో రూపొందించబడ్డాయి.
Frozen v2 ఆ సంప్రదాయాన్ని విచ్ఛిన్నం చేస్తోంది. ఒకే మోడల్ ఫ్యామిలీ తగినంత క్వెరీ వాల్యూమ్ను కలిగి ఉన్నప్పుడు, ఆ మోడల్కు అనుగుణంగా రూపొందించిన కస్టమ్ సిలికాన్ తన ఖర్చును అనేక రెట్లు వెనక్కి తెచ్చి లాభాలను అందించగలదని ఇది అంగీకరించడమే. ఇతర హైపర్స్కేలర్లు కూడా ఇలాంటి లాజిక్నే అనుసరించారు—ఉదాహరణకు Amazon యొక్క Trainium మరియు Inferentia చిప్లు—కానీ Google యొక్క విధానం సాధారణ నెట్వర్క్ క్లాస్ కంటే ఒక నిర్దిష్ట మోడల్ ఆర్కిటెక్చర్ చుట్టూ హార్డ్వేర్ను కో-డిజైన్ చేయడం ద్వారా మరింత లోతుగా వెళ్తుంది.
అయితే, ఇందులో ఉన్న రిస్క్ ఏమిటంటే వశ్యత లేకపోవడం (rigidity). ఒకవేళ Gemini ఆర్కిటెక్చర్ హార్డ్కోడ్ చేయబడిన సర్క్యూట్లు తట్టుకోలేనంత కొత్త దిశలో మారుతుంటే, Google తన కొత్త ఆలోచనలను నడపలేని ఖరీదైన సిలికాన్తో ఇబ్బంది పడవచ్చు. అందుకే ఆర్కిటెక్చర్-ఓన్లీ (architecture-only) రాజీ ముఖ్యం. ఇది ఒక మధ్యేమార్గం: అద్భుతమైన సామర్థ్య లాభాలను పొందడానికి తగినంత స్పెషలైజేషన్, మరియు కంపెనీని ఇబ్బందుల్లోకి నెట్టకుండా ఉండటానికి తగినంత ఫ్లెక్సిబిలిటీని ఇది అందిస్తుంది.
అసలైన సారాంశం
Frozen v2ని కేవలం ఒక చిప్ ప్రకటనగా కాకుండా, AI పోటీ యొక్క భవిష్యత్తు రూపంపై వేసిన వ్యూహాత్మక పందెంగా అర్థం చేసుకోవడం ఉత్తమం. విజేతలు కేవలం ఉత్తమ మోడల్లను నిర్మించడమే కాకుండా, మోడల్ బ్లూప్రింట్ నుండి ట్రాన్సిస్టర్ ద్వారా ప్రవహించే ఎలక్ట్రాన్ల వరకు మొత్తం స్టాక్ను (entire stack) తమ ఆధీనంలో ఉంచుకుంటారని Google పందెం వేస్తోంది. ఈ ప్రాజెక్ట్ విజయవంతమైతే, దాని ఫలితం బెంచ్మార్క్ స్కోర్లలో కనిపించదు. అది త్రైమాసిక ఆదాయ నివేదికలోని ఖర్చు కాలమ్లో కనిపిస్తుంది, అక్కడ ప్రతి మిలియన్ టోకెన్కు కొన్ని సెంట్లు ఆదా చేయడం ద్వారా జనరేటివ్ AIలో వాణిజ్యపరంగా సాధ్యమయ్యే అంశాల సరిహద్దులను మళ్ళీ మార్చవచ్చు.
