വലിയൊരു AI മോഡൽ വലിയ തോതിൽ പ്രവർത്തിപ്പിക്കുക എന്നത് ഒരു ശാസ്ത്രീയ നേട്ടത്തേക്കാൾ ഉപരിയായി, വൈദ്യുതി ബില്ലുകളെയും ഡാറ്റാസെന്റർ വാടകയെയും കുറിച്ചുള്ള കഠിനമായ ഒരു ഗണിത പ്രശ്നമായി മാറിയിരിക്കുന്നു. Gemini ഉൽപ്പാദിപ്പിക്കുന്ന ഓരോ ടോക്കനും ഗൂഗിളിന് യഥാർത്ഥമായ ചിലവുകൾ വരുത്തിവെക്കുന്നു—സിലിക്കൺ സൈക്കിളുകൾ, മെമ്മറി ബാൻഡ്വിഡ്ത്ത്, വൈദ്യുതി എന്നിവ ഇതിൽ ഉൾപ്പെടുന്നു. ക്വറി അളവ് കൂടുമ്പോൾ, ഒരു സെന്റിൻ്റെ ചെറിയ ഭാഗങ്ങൾ പോലും ലാഭവിഹിതത്തെ മുഴുവനായി വിഴുങ്ങാൻ ശേഷിയുള്ള വലിയ തുകകളായി മാറുന്നു. ഗൂഗിളിനുള്ളിൽ രൂപപ്പെട്ടുവരുന്ന ഒരു ആഭ്യന്തര സെർവർ ചിപ്പ് പ്രോജക്റ്റായ Frozen v2-ക്ക് പിന്നിലെ നിശബ്ദമായ അടിയന്തിരത ഇതാണ്. അടുത്ത തലമുറയ്ക്കായി തങ്ങളുടെ ജനറൽ-പർപ്പസ് Tensor Processing Units പരിഷ്കരിക്കുന്നതിന് പകരം, കമ്പനി കൂടുതൽ വിപ്ലവകരമായ ഒന്ന് പരീക്ഷിക്കുകയാണ്: Gemini മോഡലിന്റെ അസ്ഥികൂടത്തെ നേരിട്ട് സിലിക്കണിൽ തന്നെ രൂപപ്പെടുത്തുക.
വഴക്കമുള്ള Accelerators-ൽ നിന്ന് മോഡൽ-പ്രത്യേക സിലിക്കണിലേക്ക്
ഗൂഗിളിന്റെ ഇൻഫ്രാസ്ട്രക്ചറിലെ പ്രധാന ഘടകങ്ങളായി ഗൂഗിളിന്റെ TPUs ഏകദേശം ഒരു പതിറ്റാണ്ടായി പ്രവർത്തിക്കുന്നു. അവ മോഡലുകളെ പരിശീലിപ്പിക്കുന്നു, സെർച്ച് റാങ്കിംഗ് അൽഗോരിതങ്ങൾക്ക് കരുത്ത് പകരുന്നു, കൂടാതെ Nvidia-യുടെ GPUs-ന് പകരമായി മറ്റൊന്ന് തേടുന്ന Meta ഉൾപ്പെടെയുള്ള ക്ലൗഡ് ഉപഭോക്താക്കൾക്ക് മണിക്കൂർ കണക്കിന് വാടകയ്ക്കും നൽകുന്നു. ആ വൈവിധ്യമാണ് ഒരു TPU-യെ ഒരു TPU ആക്കി മാറ്റുന്നത്. സോഫ്റ്റ്വെയറിൽ വിവരിക്കാൻ കഴിയുന്ന ഏത് ന്യൂറൽ നെറ്റ്വർക്കിനും ഉപയോഗിക്കാൻ കഴിയുന്ന മാട്രിക്സ് മൾട്ടിപ്ലിക്കേഷൻ, മെമ്മറി മൂവ്മെന്റ് എന്നിവയുടെ പൊതുവായ ഭാഷയാണ് ഇത് കൈകാര്യം ചെയ്യുന്നത്.
Frozen v2 മനഃപൂർവ്വം ആ വഴക്കം ഉപേക്ഷിക്കുന്നു. Gemini-യുടെ ആർക്കിടെക്ചറിനെ നേരിട്ട് പ്രതിഫലിപ്പിക്കുന്ന സർക്യൂട്ടുകളുള്ള ഒരു ഡൊമെയ്ൻ-സ്പെസിഫിക് ആക്സിലറേറ്ററായേ ഈ ചിപ്പ് രൂപകൽപ്പന ചെയ്തിട്ടുള്ളൂ. ഒരു TPU നിർദ്ദേശങ്ങൾ ശേഖരിക്കുകയും അവയെ സോഫ്റ്റ്വെയർ പ്രവർത്തനങ്ങളായി വ്യാഖ്യാനിക്കുകയും ചെയ്യുമ്പോൾ, Frozen v2 മോഡലിന്റെ ഘടനാപരമായ ബ്ലൂപ്രിന്റ്—അതായത് അതിന്റെ ലെയറുകളുടെയും ഡാറ്റ പാത്തുകളുടെയും ക്രമീകരണം—നേരിട്ട് ചിപ്പിന്റെ ലേഔട്ടിൽ തന്നെ പതിപ്പിക്കുന്നു. മോഡലും മെറ്റലും തമ്മിലുള്ള ഈ അടുത്ത ബന്ധം, AI പ്രതികരണങ്ങൾ നൽകുന്ന കാര്യത്തിൽ നിലവിലുള്ള TPUs-നേക്കാൾ ആറ് മുതൽ പത്ത് മടങ്ങ് വരെ കാര്യക്ഷമത നൽകുമെന്ന് ഗൂഗിൾ പ്രതീക്ഷിക്കുന്നു. ഓരോ ക്വറിക്കും കുറഞ്ഞ കമ്പ്യൂട്ട് സ്റ്റെപ്പുകൾ എന്നാൽ ഒരു ടോക്കൺ വരാനുള്ള കാത്തിരിപ്പ് സമയം കുറയുന്നു, അത് നിർമ്മിക്കാൻ ആവശ്യമായ ഊർജ്ജവും വളരെ കുറയുന്നു.
ഇത് ഒരേ ആശയത്തിന്റെ വേഗതയേറിയ പതിപ്പ് മാത്രമല്ല. ഇത് ചിപ്പുകളുടെ മറ്റൊരു വിഭാഗമാണ്, പൊതുവായ ഉപയോഗത്തിന് പകരം ഒരു പ്രത്യേക മോഡൽ കുടുംബത്തിന് വേണ്ടി മാത്രം സമർപ്പിക്കപ്പെട്ട ഒന്ന്.
എന്തുകൊണ്ട് ആദ്യത്തെ “Frozen” ഉരുകിപ്പോയി?
ഈ സമീപനത്തിന് Google DeepMind-ലെ ചീഫ് സയന്റിസ്റ്റായ ജെഫ് ഡീൻ അവതരിപ്പിച്ച ഒരു പഴയ ആശയത്തിന്റെ വേരുകളുണ്ട്. ആർക്കിടെക്ചർ മാത്രമല്ല, മോഡൽ വെയിറ്റുകൾ (Gemini-യുടെ പഠിച്ച പെരുമാറ്റത്തെ രൂപപ്പെടുത്തുന്ന കോടിക്കണക്കിന് ട്യൂൺ ചെയ്ത പാരാമീറ്ററുകൾ) കൂടി നേരിട്ട് ചിപ്പിൽ തന്നെ ഹാർഡ്കോഡ് ചെയ്തുകൊണ്ട് സ്പെഷ്യലൈസേഷൻ ഇനിയും വർദ്ധിപ്പിക്കണമെന്ന് ആദ്യത്തെ “Frozen” നിർദ്ദേശം നിർദ്ദേശിച്ചിരുന്നു.
ഇതിന്റെ യുക്തി ശരിയായിരുന്നു. മോഡൽ ഉപയോഗിക്കുന്ന കൃത്യമായ സംഖ്യകൾ നിങ്ങൾക്ക് അറിയാമെങ്കിൽ, അവ എന്തിനാണ് എക്സ്റ്റേണൽ മെമ്മറിയിൽ നിന്ന് ശേഖരിക്കുന്നത്? അവ ട്രാൻസിസ്റ്ററുകളിൽ തന്നെ കൊത്തിവെച്ചാൽ കാലതാമസത്തിന്റെ വലിയൊരു വിഭാഗം ഒഴിവാക്കാം.
പ്രശ്നം അതിന്റെ സ്ഥിരതയായിരുന്നു. AI മോഡലുകൾ ഒരേപോലെ നിൽക്കുന്നവയല്ല. ഗൂഗിൾ നിരന്തരം Gemini അപ്ഡേറ്റ് ചെയ്യുന്നു, പുതിയ ഡാറ്റ ഉപയോഗിച്ച് വീണ്ടും പരിശീലിപ്പിക്കുന്നു, പാരാമീറ്ററുകൾ ക്രമീകരിക്കുന്നു, മെച്ചപ്പെട്ട പതിപ്പുകൾ പുറത്തിറക്കുന്നു. സിലിക്കണിൽ വെയിറ്റുകൾ ഫ്രോസൺ ആയ ഒരു ചിപ്പ്, പുതിയൊരു മോഡൽ പതിപ്പ് പുറത്തിറങ്ങുന്ന നിമിഷം ഒരു പേപ്പർ വെയിറ്റ് മാത്രമായി മാറും. ആ വഴക്കമില്ലായ്മയാണ് ആദ്യത്തെ ആശയം പരാജയപ്പെടുത്തിയത്.
ആങ്കർ ഇല്ലാത്ത ആർക്കിടെക്ചർ
ആർക്കിടെക്ചർ ഹാർഡ്കോഡ് ചെയ്യുകയും എന്നാൽ വെയിറ്റുകൾ മാറ്റാൻ അനുവദിക്കുകയും ചെയ്തുകൊണ്ട് Frozen v2 ഈ കാലഹരണപ്പെടൽ കെണി ഒഴിവാക്കുന്നു. കാറിനെ റോഡിൽ വെൽഡ് ചെയ്യുന്നതിന് പകരം ഒരു കസ്റ്റം റേസ്ട്രാക്ക് നിർമ്മിക്കുന്നത് പോലെ ഇതിനെ കരുതുക. സർക്യൂട്ടിന്റെ രൂപം Gemini-യുടെ പ്രത്യേക കമ്പ്യൂട്ടേഷൻ രീതികൾക്കായി ഒരേപോലെ നിലനിൽക്കും, എന്നാൽ ആ സർക്യൂട്ടുകളിലൂടെ ഒഴുകുന്ന ഉള്ളടക്കം മെമ്മറിയിൽ നിന്ന് പുതിയ വെയിറ്റുകൾ ലോഡ് ചെയ്തുകൊണ്ട് പുതുക്കാൻ കഴിയും.
പ്രായോഗികമായി ഈ വ്യത്യാസം വളരെ പ്രധാനമാണ്. എഞ്ചിനീയർമാർ ഒരു പുതിയ Gemini ചെക്ക്പോയിന്റ് പരിശീലിപ്പിക്കുമ്പോൾ, പുതിയൊരു ചിപ്പ് നിർമ്മിക്കാതെ തന്നെ അവ Frozen v2 ഹാർഡ്വെയറിൽ ഉപയോഗിക്കാൻ കഴിയും. ഏത് ഘടനാപരമായ ഘടകങ്ങളാണ് സിലിക്കണിൽ തന്നെ സ്ഥിരപ്പെടുത്തേണ്ടതെന്നും ഏതൊക്കെ മാറ്റാൻ അനുവദിക്കണമെന്നും തീരുമാനിക്കേണ്ടത് ഗൂഗിളിനുള്ളിലെ ടീമുകളാണ്. എന്നാൽ ഇതിന്റെ അടിസ്ഥാന തത്വം വ്യക്തമാണ്. രൂപം ഫ്രീസ് ചെയ്യുകയും പാരാമീറ്ററുകൾ എളുപ്പത്തിൽ മാറ്റുകയും ചെയ്യുന്നതിലൂടെ, മാറ്റങ്ങൾ വരുത്താനുള്ള ശേഷി നഷ്ടപ്പെടുത്താതെ തന്നെ കാര്യക്ഷമത നിലനിർത്താൻ ഗൂഗിളിന് സാധിക്കുന്നു.
ഇൻ-ഹൗസ് ആയി നിലനിർത്തുന്നതിന്റെ സാമ്പത്തികവശങ്ങൾ
Frozen v2 ഗൂഗിൾ ക്ലൗഡിന്റെ പ്രൈസിംഗ് ഷീറ്റിൽ കാണാത്തതിന് മറ്റൊരു കാരണമുണ്ട്. ഈ ചിപ്പ് Gemini-യുടെ ആന്തരിക ഘടനയ്ക്ക് അനുസൃതമായി രൂപകൽപ്പന ചെയ്തതായതുകൊണ്ട്, PyTorch അല്ലെങ്കിൽ കസ്റ്റം Transformer വേരിയന്റുകൾ ഉപയോഗിക്കുന്ന പുറത്തുള്ള ഡെവലപ്പർമാർക്ക് ഇത് വലിയ പ്രയോജനകരമാകില്ല. ഇതൊരു ജനറൽ-പർപ്പസ് ഉൽപ്പന്നമായി വിൽക്കാൻ ഗൂഗിളിന് പദ്ധതിയില്ല. ഗൂഗിളിന്റെ സ്വന്തം ഡാറ്റാസെന്ററുകളിലെ ഇൻഫറൻസ് കപ്പാസിറ്റിക്കായുള്ള വൻതോതിലുള്ള ആവശ്യം നിറവേറ്റുന്നതിനായി ഇതൊരു ആഭ്യന്തര ടൂൾ ആയി തുടരും.
ആ തീരുമാനം ഒരു കടുത്ത സാമ്പത്തിക യാഥാർത്ഥ്യത്തെയാണ് പ്രതിഫലിപ്പിക്കുന്നത്. നിലവിലെ ജനറേറ്റീവ് AI വിപണിയിൽ, മോഡലുകളുടെ ശേഷികൾ വേഗത്തിൽ ഒരേ തലത്തിലേക്ക് മാറിക്കൊണ്ടിരിക്കുകയാണ്. എതിരാളികൾ തമ്മിലുള്ള വ്യത്യാസം പലപ്പോഴും ഓരോ ടോക്കണിനും ഏറ്റവും കുറഞ്ഞ ചിലവിൽ ഏറ്റവും വലിയ മോഡൽ പ്രവർത്തിപ്പിക്കാൻ ആർക്ക് സാധിക്കും എന്നതിനെ ആശ്രയിച്ചിരിക്കുന്നു. ഇൻഫറൻസ് (Inference) എന്നത് ഇനി ട്രെയിനിംഗിന് ശേഷമുള്ള ഒരു അനുബന്ധ കാര്യമായി മാത്രം അവശേഷിക്കുന്നില്ല; Gemini പോലുള്ള വ്യാപകമായി ഉപയോഗിക്കപ്പെടുന്ന ഒരു ഉൽപ്പന്നത്തിന്, അത് പ്രധാനപ്പെട്ട ചിലവാണ്. Frozen v2 ആ ചിലവ് ആറിരട്ടിയിലോ അതിലധികമോ കുറയ്ക്കുകയാണെങ്കിൽ, എതിരാളികൾക്ക് എളുപ്പത്തിൽ എത്തിപ്പിടിക്കാൻ കഴിയാത്ത ഒരു മുൻതൂക്കം Google നേടും. ഈ ലാഭം ലാഭവിഹിതമായി (margin) സൂക്ഷിക്കാനോ അല്ലെങ്കിൽ API ഉപഭോക്താക്കൾക്കും ഉൽപ്പന്ന സംയോജനങ്ങൾക്കും (product integrations) കുറഞ്ഞ വിലയായി നൽകാനോ Google-ന് സാധിക്കും, ഇത് OpenAI, Anthropic എന്നിവർക്കും മറ്റുള്ളവർക്കും മേൽ സമ്മർദ്ദം വർദ്ധിപ്പിക്കും.
ഇത് വ്യവസായത്തിന് നൽകുന്ന സൂചനകൾ
Google-ന്റെ ഈ നീക്കം വിപുലമായ ഹാർഡ്വെയർ തന്ത്രം ഏത് ദിശയിലേക്കാണ് നീങ്ങുന്നത് എന്നതിനെക്കുറിച്ചും സൂചന നൽകുന്നു. വർഷങ്ങളായി, പരമാവധി വഴക്കമുള്ള (flexible) ഒരു ആക്സിലറേറ്റർ നിർമ്മിക്കുകയും സോഫ്റ്റ്വെയർ ഉപയോഗിച്ച് അതിനെ പ്രത്യേക ആവശ്യങ്ങൾക്കായി ക്രമീകരിക്കുകയും ചെയ്യുക എന്നതായിരുന്നു സാധാരണ രീതി. മോളിക്യുലാർ ഡൈനാമിക്സ് മുതൽ വീഡിയോ ഗെയിമുകൾ വരെയും ലാർജ് ലാംഗ്വേജ് മോഡലുകൾ വരെയും എല്ലാം പ്രവർത്തിപ്പിക്കാൻ കഴിയുന്നതുകൊണ്ടാണ് Nvidia-യുടെ GPU-കൾ ആധിപത്യം പുലർത്തുന്നത്. Google-ന്റെ സ്വന്തം TPU-കളും ഇതേ സാർവത്രിക ഉപയോഗക്ഷമത എന്ന ലക്ഷ്യത്തോടെയാണ് വിഭാവനം ചെയ്തത്.
Frozen v2 ആ പാരമ്പര്യത്തിൽ നിന്നുള്ള ഒരു മാറ്റമാണ്. ഒരു പ്രത്യേക മോഡൽ ഫാമിലിക്ക് ആവശ്യത്തിന് ക്വറി വോളിയം (query volume) ലഭിക്കുമ്പോൾ, ആ മോഡലിന് അനുയോജ്യമായ രീതിയിൽ രൂപകൽപ്പന ചെയ്ത കസ്റ്റം സിലിക്കൺ (custom silicon) അതിന്റെ ചിലവ് പലമടങ്ങ് ലാഭത്തിലൂടെ തിരിച്ചുപിടിക്കുമെന്ന് ഇത് സമ്മതിക്കുന്നു. മറ്റ് ഹൈപ്പർസ്കെയിലർമാരും (hyperscalers) സമാനമായ യുക്തി പിന്തുടർന്നിട്ടുണ്ട്—ഉദാഹരണത്തിന് Amazon-ന്റെ Trainium, Inferentia ചിപ്പുകൾ—എന്നാൽ ഒരു പൊതുവായ നെറ്റ്വർക്ക് ക്ലാസ്സിന് പകരം ഒരു പ്രത്യേക മോഡൽ ആർക്കിടെക്ചറിന് ചുറ്റും ഹാർഡ്വെയർ സഹ-രൂപകൽപ്പന (co-designing) ചെയ്യുന്നതിലൂടെ Google-ന്റെ സമീപനം കൂടുതൽ ആഴത്തിലുള്ളതാണ്.
തീർച്ചയായും, ഇതിലെ അപകടം അതിന്റെ കർക്കശ സ്വഭാവമാണ് (rigidity). Gemini-യുടെ ആർക്കിടെക്ചർ ഹാർഡ്കോഡ് ചെയ്ത സർക്യൂട്ടുകൾക്ക് ഉൾക്കൊള്ളാൻ കഴിയാത്ത രീതിയിൽ മാറിക്കൊണ്ടിട്ടാൽ, പുതിയ ആശയങ്ങൾ പ്രവർത്തിപ്പിക്കാൻ കഴിയാത്ത വിലകൂടിയ സിലിക്കൺ കയ്യിൽ വരുന്ന അവസ്ഥയിൽ Google അകപ്പെട്ടേക്കാം. അതുകൊണ്ടാണ് ആർക്കിടെക്ചർ-മാത്രം അടിസ്ഥാനമാക്കിയുള്ള വിട്ടുവീഴ്ച (architecture-only compromise) പ്രസക്തമാകുന്നത്. ഇത് ഒരു മധ്യമാർഗ്ഗം വാഗ്ദാനം ചെയ്യുന്നു: വലിയ തോതിലുള്ള കാര്യക്ഷമത നേടാൻ ആവശ്യമായ പ്രത്യേകതയും (specialization), കമ്പനിയെ പ്രതിസന്ധിയിലാക്കാത്ത തരത്തിലുള്ള വഴക്കവും (flexibility) ഇതിലുണ്ട്.
യഥാർത്ഥ പാഠം
Frozen v2-നെ ഒരു ചിപ്പ് പ്രഖ്യാപനമായി കാണുന്നതിനേക്കാൾ, AI മത്സരത്തിന്റെ ഭാവി രൂപത്തെക്കുറിച്ചുള്ള ഒരു തന്ത്രപരമായ പന്തയമായി കാണുന്നതാണ് ഉചിതം. മികച്ച മോഡലുകൾ നിർമ്മിക്കുക മാത്രമല്ല, മോഡലിന്റെ ബ്ലൂപ്രിന്റ് മുതൽ ട്രാൻസിസ്റ്ററിലൂടെ കടന്നുപോകുന്ന ഇലക്ട്രോണുകൾ വരെ - മുഴുവൻ സ്റ്റാക്കും (entire stack) സ്വന്തമാക്കുന്നവരായിരിക്കും വിജയികൾ എന്ന് Google പന്തയം വെക്കുന്നു. ഈ പദ്ധതി വിജയിച്ചാൽ, അതിന്റെ ഫലം ബെഞ്ച്മാർക്ക് സ്കോറുകളിൽ (benchmark scores) ആയിരിക്കില്ല കാണപ്പെടുക. അത് ഒരു പാദവാർഷിക വരുമാന റിപ്പോർട്ടിലെ (quarterly earnings report) ചിലവ് കോളത്തിലാണ് കാണപ്പെടുക; അവിടെ ഓരോ പത്ത് ലക്ഷം ടോക്കണുകൾക്കും ലാഭിക്കുന്ന ഏതാനും സെന്റുകൾ ജനറേറ്റീവ് AI-യിൽ വാണിജ്യപരമായി സാധ്യമായ കാര്യങ്ങളുടെ അതിരുകൾ പുനർനിർണ്ണയിച്ചേക്കാം.
