મોટા પાયે AI મોડલ ચલાવવું એ હવે વૈજ્ઞાનિક સિદ્ધિ કરતાં વીજળીના બિલ અને ડેટા સેન્ટરના ભાડા વિશેની એક કઠિન ગાણિતિક સમસ્યા વધુ બની ગઈ છે. Gemini દ્વારા જનરેટ કરવામાં આવતો દરેક ટોકન Google માટે વાસ્તવિક ખર્ચ લાવે છે—સિલિકોન સાયકલ, મેમરી બેન્ડવિડ્થ અને પાવર સપ્લાયમાંથી વપરાતા વોટ્સ. જેમ જેમ ક્વેરીનું પ્રમાણ વધે છે, તેમ તેમ સેન્ટના અંશો પણ એવા મોટા sums માં ફેરવાઈ જાય છે જે નફાના માર્જિનને સંપૂર્ણપણે ખાઈ શકે છે. આ શાંત તાકીદ Frozen v2 ની પાછળ છે, જે Google ની અંદર અત્યારે આકાર લઈ રહેલો એક આંતરિક સર્વર ચિપ પ્રોજેક્ટ છે. તેના સામાન્ય હેતુ માટેના Tensor Processing Units ને બીજી પેઢી માટે વધુ સુધારીને, કંપની કંઈક વધુ ક્રાંતિકારી કરવાનો પ્રયાસ કરી રહી છે: Gemini મોડલના હાડપિંજરને સીધું જ સિલિકોનમાં કંડારવું.

લવચીક એક્સિલરેટર્સથી મોડલ-વિશિષ્ટ સિલિકોન સુધી

Google ના TPUs લગભગ એક દાયકાથી તેના ઇન્ફ્રાસ્ટ્રક્ચરના મુખ્ય કામદારો રહ્યા છે. તેઓ મોડલ્સને ટ્રેન કરે છે, સર્ચ રેન્કિંગ અલ્ગોરિધમ્સને શક્તિ આપે છે, અને Meta સહિતના ક્લાઉડ ગ્રાહકોને કલાકના આધારે ભાડે પણ આપે છે, જે Nvidia ના GPUs નો વિકલ્પ શોધી રહ્યા છે. આ જ બહુમુખી પ્રતિભા (versatility) TPU ને TPU બનાવે છે. તે મેટ્રિક્સ ગુણાકાર અને મેમરી મૂવમેન્ટની એક સામાન્ય ભાષા સમજે છે, જે તમે સોફ્ટવેરમાં વર્ણવી શકો તેવા લગભગ કોઈપણ ન્યુરલ નેટવર્ક દ્વારા ઉપયોગમાં લઈ શકાય છે.

Frozen v2 જાણીજોઈને તે લવચીકતાનો ત્યાગ કરે છે. આ ચિપને ડોમેન-સ્પેસિફિક એક્સિલરેટર તરીકે ડિઝાઇન કરવામાં આવી રહી છે જેના સર્કિટ્સ Gemini ના પોતાના આર્કિટેક્ચરના ભાગોનું ભૌતિક રીતે પ્રતિબિંબ પાડે છે. જ્યાં TPU સૂચનાઓ મેળવે છે અને તેને સોફ્ટવેર ઓપરેશન્સ તરીકે અર્થઘટન કરે છે, ત્યાં Frozen v2 મોડલના સ્ટ્રક્ચરલ બ્લુપ્રિન્ટ—તેના લેયર્સ અને ડેટા પાથનું આયોજન—સીધું જ ચિપના લેઆઉટમાં કંડારી દેશે. Google ને આશા છે કે મોડલ અને મેટલનું આ ગાઢ જોડાણ AI પ્રતિસાદો આપવા માટે ચિપને વર્તમાન TPUs કરતા છ થી દસ ગણી વધુ કાર્યક્ષમ બનાવશે. ક્વેરી દીઠ ઓછા કમ્પ્યુટ સ્ટેપ્સનો અર્થ છે ટોકન દેખાય તેની રાહ જોવામાં ઓછો સમય, અને તેને જનરેટ કરવામાં વપરાતી ઘણી ઓછી ઉર્જા.

આ માત્ર એ જ વિચારનું ઝડપી સંસ્કરણ નથી. તે ચિપની એક અલગ શ્રેણી છે, જે સામાન્ય ઉપયોગને બદલે એક જ મોડલ ફેમિલી પ્રત્યે સમર્પણ પસંદ કરે છે.

શા માટે પ્રથમ “Frozen” ઓગળી ગયું

આ અભિગમ Google DeepMind ના ચીફ સાયન્ટિસ્ટ જેફ ડીન સાથે જોડાયેલ એક અગાઉના ખ્યાલમાં મૂળ ધરાવે છે. મૂળ “Frozen” પ્રસ્તાવમાં માત્ર આર્કિટેક્ચર જ નહીં, પરંતુ વાસ્તવિક મોડલ વેટ્સ (weights)—એટલે કે Gemini ના શીખેલા વર્તનને બનાવતા અબજો ટ્યુન કરેલા પેરામીટર્સ—ને સીધા જ ચિપમાં હાર્ડકોડ કરીને સ્પેશિયલાઇઝેશનને વધુ આગળ વધારવાનું સૂચવવામાં આવ્યું હતું.

તર્ક યોગ્ય હતો. જો તમે ચોક્કસપણે જાણતા હોવ કે મોડલ કયા નંબરોનો ઉપયોગ કરશે, તો તેને એક્સટર્નલ મેમરીમાંથી મેળવવાની શું જરૂર? તમે તેને ટ્રાન્ઝિસ્ટરમાં કંડારી શકો છો અને વિલંબ (delay) ના આખા પ્રકારોને દૂર કરી શકો છો.

સમસ્યા કાયમી હોવાની હતી. AI મોડલ્સ સ્થિર રહેતા નથી. Google સતત Gemini ને અપડેટ કરે છે, નવા ડેટા પર ફરીથી ટ્રેન કરે છે, પેરામીટર્સ એડજસ્ટ કરે છે અને સુધારેલા વર્ઝન બહાર પાડે છે. સિલિકોનમાં ફ્રોઝન વેટ્સ ધરાવતી ચિપ નવા મોડલ રિવિઝન આવતાની સાથે જ નકામી (paperweight) બની જાય. લવચીકતાના અભાવે મૂળ ખ્યાલને ખતમ કરી દીધો.

એન્કર વગરનું આર્કિટેક્ચર

Frozen v2 આર્કિટેક્ચરને હાર્ડકોડ કરીને અને વેટ્સને બદલવા માટે મુક્ત રાખીને અપ્રચલિત થવાના જોખમને ઉકેલે છે. તેને રસ્તા સાથે કારને વેલ્ડિંગ કરવાને બદલે કસ્ટમ રેસટ્રેક બનાવવા જેવું સમજો. સર્કિટનો આકાર નિશ્ચિત રહે છે, જે Gemini ના ચોક્કસ કમ્પ્યુટેશન પેટર્ન માટે ઓપ્ટિમાઇઝ કરેલ છે, પરંતુ તે સર્કિટમાંથી વહેતી સામગ્રીને મેમરીમાંથી નવા વેટ્સ લોડ કરીને તાજી કરી શકાય છે.

વ્યવહારમાં આ તફાવત મહત્વનો છે. જ્યારે એન્જિનિયરો નવું Gemini ચેકપોઈન્ટ ટ્રેન કરે છે, ત્યારે તેઓ નવું ચિપ બનાવ્યા વગર તેને Frozen v2 હાર્ડવેર પર તૈનાત કરી શકે છે. હાર્ડકોડિંગનું ચોક્કસ પ્રમાણ હજુ પણ Google ની અંદર એક ખુલ્લો પ્રશ્ન છે; ટીમોએ ચોક્કસપણે નક્કી કરવું પડશે કે કયા સ્ટ્રક્ચરલ તત્વો સિલિકોન અમરત્વને લાયક છે અને કયા કન્ફિગરેબલ રહેવા જોઈએ. પરંતુ સિદ્ધાંત નક્કી છે. આકારને ફ્રીઝ કરીને અને પેરામીટર્સને લવચીક રીતે બદલીને, Google પુનરાવર્તન કરવાની ક્ષમતાનો ત્યાગ કર્યા વિના કાર્યક્ષમતા જાળવી રાખે છે.

તેને ઇન-હાઉસ રાખવાના અર્થશાસ્ત્ર

બીજું એક કારણ છે કે તમે Frozen v2 ને Google Cloud ના પ્રાઇસિંગ શીટ પર નહીં જુઓ. કારણ કે આ ચિપ Gemini ના આંતરિક માળખા મુજબ એટલી ગાઢ રીતે બનાવવામાં આવી છે કે PyTorch અથવા કસ્ટમ Transformer વેરિઅન્ટ્સ ચલાવતા બહારના ડેવલપર્સ માટે તેનો બહુ ઓછો અર્થ નીકળશે. Google ને તેને સામાન્ય હેતુના ઉત્પાદન તરીકે વેચવાની કોઈ યોજના નથી. તે એક આંતરિક સાધન તરીકે રહેશે, જેનો મુખ્ય ઉદ્દેશ્ય Google ના પોતાના ડેટા સેન્ટર્સમાં ઇન્ફરન્સ ક્ષમતાની ભારે માંગને સંતોષવાનો છે.

આ પસંદગી એક કઠોર આર્થિક વાસ્તવિકતા દર્શાવે છે. વર્તમાન જનરેટિવ AI માર્કેટમાં, મોડલની ક્ષમતાઓ ઝડપથી એકબીજાની નજીક આવી રહી છે. સ્પર્ધકો વચ્ચેનો તફાવત ઘણીવાર એ બાબત પર નિર્ભર હોય છે કે કોણ સૌથી ઓછા પ્રતિ ટોકન ખર્ચ પર સૌથી મોટું મોડલ ચલાવવાનું પરવડે તેમ છે. ઇન્ફરન્સ (Inference) હવે ટ્રેનિંગ પછીનો વિચાર નથી; Gemini જેવા વ્યાપકપણે ઉપયોગમાં લેવાતા ઉત્પાદન માટે, તે મુખ્ય ખર્ચ છે. જો Frozen v2 તે ખર્ચમાં છ ગણો કે તેથી વધુ ઘટાડો કરે છે, તો Google ને એવી વધારાની ક્ષમતા (headroom) મળશે જેની સ્પર્ધકો સરળતાથી સ્પર્ધા કરી શકશે નહીં. તે બચતને નફા (margin) તરીકે રાખી શકે છે અથવા API ગ્રાહકો અને પ્રોડક્ટ ઇન્ટિગ્રેશન માટે નીચા ભાવ તરીકે આપી શકે છે, જેનાથી OpenAI, Anthropic અને અન્ય કંપનીઓ પર દબાણ વધશે.

આ ઉદ્યોગ માટે શું સંકેત આપે છે

Googleનું આ પગલું વ્યાપક હાર્ડવેર વ્યૂહરચના કઈ દિશામાં જઈ રહી છે તેનો પણ સંકેત આપે છે. વર્ષોથી, પ્રમાણભૂત પદ્ધતિ શક્ય તેટલો સૌથી લવચીક (flexible) એક્સિલરેટર બનાવવાની અને સ્પેશિયલાઇઝેશન માટે સોફ્ટવેર પર છોડી દેવાની હતી. Nvidia ના GPUsનું વર્ચસ્વ છે કારણ કે તેઓ મોલેક્યુલર ડાયનેમિક્સથી લઈને વિડિયો ગેમ્સ અને લાર્જ લેંગ્વેજ મોડલ્સ સુધી બધું જ ચલાવી શકે છે. Google ના પોતાના TPUs પણ વ્યાપક ઉપયોગિતાના એ જ ભાવના સાથે બનાવવામાં આવ્યા હતા.

Frozen v2 આ પરંપરાથી અલગ પડે છે. તે એક સ્વીકૃતિ છે કે જ્યારે એક જ મોડલ ફેમિલી પૂરતો ક્વેરી વોલ્યુમ (query volume) જનરેટ કરે છે, ત્યારે તે મોડલ માટે ખાસ બનાવેલ કસ્ટમ સિલિકોન તેના ખર્ચને અનેકગણો વસૂલ કરી શકે છે. અન્ય હાઇપરસ્કેલર્સ (hyperscalers) એ પણ સમાન તર્ક અપનાવ્યો છે—દાખલા તરીકે, Amazon ના Trainium અને Inferentia ચિપ્સ—પરંતુ Google નો અભિગમ નેટવર્ક્સના સામાન્ય વર્ગને બદલે ચોક્કસ મોડલ આર્કિટેક્ચરની આસપાસ હાર્ડવેરને સહ-ડિઝાઇન (co-designing) કરીને વધુ ઊંડો છે.

જોકે, જોખમ ચોક્કસપણે જડતાનું (rigidity) છે. જો Gemini નું આર્કિટેક્ચર એવી દિશામાં વિકસે જે હાર્ડકોડેડ સર્કિટ્સ સમાવી ન શકે, તો Google પાસે એવું મોંઘું સિલિકોન હોઈ શકે છે જે તેના નવા વિચારો ચલાવી શકતું નથી. આ જ કારણ છે કે માત્ર આર્કિટેક્ચર-આધારિત સમાધાન મહત્વનું છે. તે એક મધ્યમ માર્ગ પ્રદાન કરે છે: નોંધપાત્ર કાર્યક્ષમતાના લાભો મેળવવા માટે પૂરતી સ્પેશિયલાઇઝેશન અને કંપનીને મુશ્કેલીમાં ન મૂકે તેટલી લવચીકતા (flexibility).

વાસ્તવિક નિષ્કર્ષ

Frozen v2 ને માત્ર ચિપની જાહેરાત તરીકે નહીં, પરંતુ AI સ્પર્ધાના ભવિષ્યના સ્વરૂપ પર એક વ્યૂહાત્મક દાવ તરીકે સમજવું જોઈએ. Google એવો દાવ લગાવી રહ્યું છે કે વિજેતાઓ માત્ર શ્રેષ્ઠ મોડલ્સ જ નહીં બનાવશે, પરંતુ તેઓ આખું સ્ટેક (entire stack) ધરાવશે—મોડલના બ્લુપ્રિન્ટથી લઈને ટ્રાન્ઝિસ્ટરમાંથી પસાર થતા ઇલેક્ટ્રોન સુધી. જો આ પ્રોજેક્ટ સફળ થશે, તો તેનો ફાયદો બેન્ચમાર્ક સ્કોરમાં દેખાશે નહીં. તે ત્રિમાસિક અર્નિંગ રિપોર્ટના ખર્ચના કોલમમાં દેખાશે, જ્યાં પ્રતિ મિલિયન ટોકન પર બચાવેલા થોડા સેન્ટ્સ જનરેટિવ AI માં વ્યાપારી રીતે શું શક્ય છે તેની સીમાઓને ફરીથી નક્કી કરી શકે છે.