Hugging Face എന്നത് വെറുമൊരു മോഡൽ സൂ (model zoo) എന്നതിലുപരിയായി മാറിയിരിക്കുന്നു. അവിടെ ട്രെൻഡിംഗ് ആകുന്ന ഗവേഷണ പ്രബന്ധങ്ങൾ (papers) AI കമ്മ്യൂണിറ്റി എങ്ങോട്ടാണ് യഥാർത്ഥത്തിൽ നീങ്ങുന്നത് എന്നതിന്റെ സൂചന നൽകുന്നു. വർഷങ്ങളായി നിലനിന്നിരുന്ന രീതി ലളിതമായിരുന്നു: കൂടുതൽ പാരാമീറ്ററുകൾ, കൂടുതൽ ഡാറ്റ, കൂടുതൽ കമ്പ്യൂട്ട്. ആ കാലഘട്ടം അവസാനിച്ചിട്ടില്ലെങ്കിലും, അത് ഇപ്പോൾ മാത്രം പരിമിതമല്ല. പുതിയ പ്രബന്ധങ്ങൾ ഒരു വ്യക്തമായ മാറ്റം കാണിക്കുന്നു. ഈ സിസ്റ്റങ്ങൾ യഥാർത്ഥ ലോകവുമായി ഇടപഴകുമ്പോൾ എങ്ങനെ പ്രവർത്തിക്കുന്നു എന്നതിനെക്കുറിച്ച് ഗവേഷകരും നിർമ്മാതാക്കളും കൂടുതൽ ഗൗരവകരമായ ചോദ്യങ്ങൾ ചോദിക്കുന്നു. ശ്രദ്ധ ഇപ്പോൾ വെറും സ്കെയിലിംഗിൽ നിന്ന് ഓപ്പറേഷണലൈസേഷനിലേക്ക് (operationalization) മാറുകയാണ്—മോഡലുകൾ എങ്ങനെ ചിന്തിക്കുന്നു (reasoning), കുറഞ്ഞ ശേഷിയുള്ള ഹാർഡ്‌വെയറിൽ അവ എങ്ങനെ പ്രവർത്തിക്കുന്നു, ഒരു സോഫ്റ്റ്‌വെയർ എൻവയോൺമെന്റിൽ നിന്ന് മറ്റൊന്നിലേക്ക് അവ എങ്ങനെ മാറുന്നു, ശാസ്ത്രീയ മുന്നേറ്റങ്ങളെ അവ എങ്ങനെ വേഗത്തിലാക്കുന്നു എന്നിവയ്ക്കാണ് ഇപ്പോൾ മുൻഗണന.

സമ്മർദ്ദഘട്ടങ്ങളിലും നിലനിൽക്കുന്ന യുക്തിചിന്ത (Reasoning)

ലാർജ് ലാംഗ്വേജ് മോഡലുകൾ (LLMs) നാം പരിശീലിപ്പിക്കുന്ന രീതിയും അവ ഉപയോഗിക്കുന്ന രീതിയും തമ്മിൽ വളരുന്ന ഒരു വിടവുണ്ട്. ഒരു മോഡൽ ട്രെയിനിംഗിനിടെ ലോസ് (loss) വളരെ കുറഞ്ഞ രീതിയിൽ കാണിച്ചേക്കാം, എന്നാൽ ഒരു കോഡിംഗ് ബഗ്ഗോ അല്ലെങ്കിൽ പല ഘട്ടങ്ങളുള്ള ഒരു ഗണിത പ്രശ്നമോ പരിഹരിക്കാൻ ശ്രമിക്കുമ്പോൾ അത് പരാജയപ്പെട്ടേക്കാം. ഇതിനുള്ള പരിഹാരം മറ്റൊരു ട്രെയിനിംഗ് വിദ്യയല്ലെന്ന് ഒരു പുതിയ പ്രബന്ധം വാദിക്കുന്നു. ട്രെയിനിംഗ് മെട്രിക്സുകളിലെ സ്കോറിന് വേണ്ടി മാത്രമല്ല, ഇൻഫറൻസ് (inference) സമയത്ത് മോഡലുകൾ എങ്ങനെ പെരുമാറുന്നു എന്നതിനാണ് നാം മുൻഗണന നൽകേണ്ടത്. മിക്ക റൈൻഫോഴ്‌സ്‌മെന്റ് ലേണിംഗ് (reinforcement learning) പൈപ്പ്‌ലൈനുകളും ഇപ്പോഴും ട്രെയിനിംഗ് സമയത്തെ റിവാർഡുകൾക്ക് പിന്നാലെയാണ് പോകുന്നത്. ഈ മാറ്റം എന്നാൽ 'ചെയിൻ ഓഫ് തോട്ട്' (chain of thought) തന്നെ സ്ഥിരപ്പെടുത്തുക എന്നാണ് അർത്ഥമാക്കുന്നത്. കോഡിംഗ് അസിസ്റ്റന്റുകളോ മാത്സ് ട്യൂട്ടർമാരോ നിർമ്മിക്കുന്നവർക്ക് ഇതൊരു പ്രായോഗികമായ മാറ്റമാണ്. ലീഡർബോർഡ് അക്യുറസിയിൽ (leaderboard accuracy) മാത്രം വിശ്വസിക്കാതെ, പ്രോംപ്റ്റുകൾ സങ്കീർണ്ണമാകുമ്പോൾ മോഡലിന്റെ യുക്തിചിന്ത (reasoning) എത്രത്തോളം കൃത്യമായി നിലനിൽക്കുന്നു എന്ന് പരിശോധിച്ചു തുടങ്ങണം.

പഠിച്ച കാര്യങ്ങൾ മറക്കാത്ത GUI ഏജന്റുകൾ

ഏജന്റുകൾക്ക് ഒരു പ്ലാറ്റ്‌ഫോം പ്രശ്നമുണ്ട് (platform problem). ഒരു ക്രോം ടാബിൽ (Chrome tab) ഫ്ലൈറ്റുകൾ കൃത്യമായി ബുക്ക് ചെയ്യുന്ന ഒരു സിസ്റ്റം, ആൻഡ്രോയിഡ് ഫോണിലെ സെറ്റിംഗ്‌സ് മാറ്റാൻ ആവശ്യപ്പെടുമ്പോൾ പലപ്പോഴും എല്ലാം മറന്നുപോയേക്കാം. ഇതിനെ 'കാറ്റാസ്ട്രോഫിക് ഫോർഗെറ്റിംഗ്' (catastrophic forgetting) എന്ന് വിളിക്കുന്നു. പുതിയ ഗവേഷണങ്ങൾ 'മൾട്ടി-ടീച്ചർ ഡിസ്റ്റിലേഷൻ' (multi-teacher distillation) വഴി ഇതിനെ പരിഹരിക്കാൻ ശ്രമിക്കുന്നു. ഒരു ഇന്റർഫേസിൽ മാത്രം പരിശീലിപ്പിച്ച് അറിവ് കൈമാറ്റം ചെയ്യപ്പെടുമെന്ന് പ്രതീക്ഷിക്കുന്നതിന് പകരം, ഓരോ പ്ലാറ്റ്‌ഫോമിലും വൈദഗ്ധ്യമുള്ള ഒന്നിലധികം അധ്യാപകരിൽ നിന്ന് ഏജന്റ് ഒരേസമയം പഠിക്കുന്നു. സ്റ്റുഡന്റ് നെറ്റ്‌വർക്ക് വെബ്, മൊബൈൽ, ഡെസ്ക്ടോപ്പ് ലോജിക് എന്നിവ ഒരേസമയം പഠിക്കുന്നതിനാൽ, പഴയ കഴിവുകൾ നഷ്ടപ്പെടാതെ തന്നെ വിവിധ എൻവയോൺമെന്റുകളിലേക്ക് മാറാൻ ഇതിന് സാധിക്കുന്നു. ഉൽപ്പന്ന നിർമ്മാണ ടീമുകളെ സംബന്ധിച്ചിടത്തോളം, ഇതിനർത്ഥം രണ്ട് വ്യത്യസ്ത ഏജന്റ് സിസ്റ്റങ്ങൾ പരിപാലിക്കാതെ തന്നെ നിങ്ങളുടെ വെബ് ബാക്കെൻഡും (web backend) മൊബൈൽ ഫ്രണ്ട്‌എൻഡും (mobile frontend) കൈകാര്യം ചെയ്യാൻ കഴിയുന്ന ഒരു സിംഗിൾ അസിസ്റ്റന്റ് നിർമ്മിക്കാം എന്നാണ്.

വലിയ മോഡലുകളെ പ്രായോഗിക തലത്തിലേക്ക് എത്തിക്കുക

ഒരു റോബോട്ടിൽ വലിയ ഫൗണ്ടേഷൻ മോഡലുകൾ (foundation models) പ്രവർത്തിപ്പിക്കുക എന്നത് സോഫ്റ്റ്‌വെയർ പ്രശ്നമെന്നതിലുപരി ഒരു ഫിസിക്സ് പ്രശ്നമാണ്. ഒരു മോഡൽ ഒരു സെർവർ റാക്കിൽ ഒതുങ്ങുമായിരിക്കാം, പക്ഷേ ഒരു ഡ്രോണിന്റെ പവർ ബജറ്റിലോ അല്ലെങ്കിൽ ഒരു മാനുഫാക്ചറിംഗ് ആമിന്റെ ഓൺബോർഡ് കമ്പ്യൂട്ടറിലോ അത് ഒതുങ്ങില്ല. ഈ വിടവ് നികത്താനായി പുതിയൊരു C++ റൺടൈം (runtime) രൂപകൽപ്പന ചെയ്തിട്ടുണ്ട്; ഇത് ഭാരമേറിയ മോഡലുകളെ വ്യത്യസ്തതരം റോബോട്ട് ഹാർഡ്‌വെയറുകളിലേക്കും എഡ്ജ് ഡിവൈസുകളിലേക്കും (edge devices) മാറ്റാൻ സഹായിക്കുന്നു. ഇത് വേഗത്തിലുള്ള ഇൻഫറൻസ് (inference) മാത്രമല്ല, പോർട്ടബിലിറ്റിയെ (portability) കുറിച്ചുള്ളതാണ്. വിലകൂടിയ GPU-കളിൽ ലാബിൽ വികസിപ്പിച്ചെടുത്ത ഒരു മോഡലിനെ, വലിയ മാറ്റങ്ങളില്ലാതെ തന്നെ ഒരു ജെറ്റ്സൺ (Jetson) മോഡ്യൂളിലേക്കോ ഒരു റോബോട്ടിന്റെ ലോക്കൽ കൺട്രോളറിലേക്കോ മാറ്റാൻ ഇതിലൂടെ സാധിക്കും. ഒരു ഡെമോയെ ഒരു യഥാർത്ഥ ഉൽപ്പന്നമാക്കി മാറ്റുന്നത് ഈ പോർട്ടബിലിറ്റി ആണ്.

ഫിൽട്ടറിനേക്കാൾ പ്രധാനം ഡാറ്റാ റെസിപ്പിയാണ്

വിഷൻ-ലാംഗ്വേജ് മോഡലുകൾക്ക് (vision-language models) വലിയ പ്ലേറ്റുകളല്ല, മറിച്ച് മികച്ച ഭക്ഷണമാണ് (better diets) ആവശ്യം. പുതിയ ബെഞ്ച്മാർക്കുകൾ ഒരു കാര്യം വ്യക്തമാക്കുന്നു: മോശം ഡാറ്റ ഫിൽട്ടർ ചെയ്യുന്നത് പകുതി പോരാ. നിങ്ങൾ ഇമേജ് ക്യാപ്ഷനുകൾ, ചാർട്ട് പാഴ്സിംഗ്, ഗ്രൗണ്ടഡ് കൺവർസേഷൻ, വിഷ്വൽ ക്വസ്റ്റ്യൻ ആൻസ്‌വറിംഗ് എന്നിവ ഏത് അനുപാതത്തിൽ മിക്സ് ചെയ്യുന്നു എന്നതിനെ ആശ്രയിച്ചാണ് നിങ്ങളുടെ മൾട്ടിമോഡൽ അസിസ്റ്റന്റ് കാര്യങ്ങൾ കൃത്യമായി മനസ്സിലാക്കുന്നുണ്ടോ അതോ തെറ്റായ വിവരങ്ങൾ (hallucinate) നൽകുന്നുണ്ടോ എന്ന് തീരുമാനിക്കപ്പെടുന്നത്. റെസിപ്പി തെറ്റാണെങ്കിൽ, ഡാറ്റ എത്ര വൃത്തിയുള്ളതാണെങ്കിലും മോഡൽ പരാജയപ്പെടും. ഇത് ഡാറ്റാസെറ്റ് നിർമ്മാണത്തെ വെറുമൊരു ക്ലീനിംഗ് ജോലിക്കപ്പുറം ഒരു 'റെസിപ്പി എൻജിനീയറിംഗായി' (recipe engineering) മാറ്റുന്നു. നിങ്ങളുടെ ടീം ഒരു വിഷ്വൽ അസിസ്റ്റന്റ് നിർമ്മിക്കുകയാണെങ്കിൽ, ഫിൽട്ടറുകൾ മാത്രം നോക്കാതെ ഡാറ്റയുടെ മിശ്രിതം (mixtures) പരിശോധിക്കുക.

പിക്സൽ സ്പേസിലെ 3D ജനറേഷൻ

ഭൂരിഭാഗം ജനറേറ്റീവ് 3D പൈപ്പ്‌ലൈനുകളും ലോകത്തെ ഒരു ഹിഡൻ ലാറ്റന്റ് സ്പേസിലേക്ക് (hidden latent space) ചുരുക്കുന്നു. ഇതിലൂടെ വിശദാംശങ്ങൾ നഷ്ടപ്പെടുകയും വശങ്ങൾ അവ്യക്തമാവുകയും ചെയ്യുന്നു. ഒരു പെട്ടെന്നുള്ള പ്രിവ്യൂവിന് ഇത് കുഴപ്പമില്ലായിരിക്കാം, എന്നാൽ ഒരു ഗെയിം അസറ്റിനോ (game asset) അല്ലെങ്കിൽ യഥാർത്ഥ ജ്യാമിതിയുമായി (geometry) യോജിച്ചുപോകേണ്ട ഒരു AR ഓവർലേയ്‌ക്കോ ഇത് ഉപയോഗിക്കാൻ കഴിയില്ല. പുതിയ രീതികൾ ഈ തടസ്സം ഒഴിവാക്കി നേരിട്ട് പിക്സൽ സ്പേസിൽ (pixel space) പ്രവർത്തിക്കുന്നു. ഇതിലൂടെ ലഭിക്കുന്ന സീനുകൾ കൂടുതൽ വ്യക്തതയുള്ളതും സ്പേഷ്യൽ റിലേഷൻഷിപ്പുകൾ (spatial relationships) കൃത്യവുമാകും. ഗെയിമിംഗിനും AR/VR നിർമ്മാണത്തിനും ഇത് നേരിട്ട് ഉപയോഗിക്കാം. കലാകാരന്മാർക്കും ടെക്നിക്കൽ ഡയറക്ടർമാർക്കും ഇത് വളരെ പ്രധാനമാണ്, കാരണം 3D ജനറേഷൻ പ്രയാസകരമാക്കുന്ന വലിയ പോസ്റ്റ്-പ്രോസസ്സിംഗ് ജോലികൾ ഇത് ഒഴിവാക്കുന്നു.

AI ഗവേഷണത്തിലെ തിരക്കേറിയ ജോലികൾ ചെയ്യാൻ തുടങ്ങുമ്പോൾ

ഒരു ശാസ്ത്രജ്ഞന്റെ വേഗത കുറയ്ക്കുന്നത് ഗവേഷണ പ്രബന്ധം (paper) എഴുതുന്നതല്ല. പോസ്റ്ററുകൾ, മൂന്ന് മിനിറ്റ് ദൈർഘ്യമുള്ള വീഡിയോ സംഗ്രഹം, ബ്ലോഗ് രൂപമാറ്റം, സോഷ്യൽ മീഡിയ ത്രെഡുകൾ എന്നിവയാണ് ആ ഒരാഴ്ച മുഴുവൻ നഷ്ടപ്പെടുത്തുന്നത്. പുതിയ ടൂളുകൾക്ക് ഇപ്പോൾ ഒരു പ്രബന്ധം മാത്രം നൽകിയാൽ മതി, അവ സ്വയം തന്നെ ആ ആശയവിനിമയ സംവിധാനങ്ങളെല്ലാം (communication stack) തയ്യാറാക്കി നൽകുന്നു. കണ്ടുപിടുത്തങ്ങളുടെ കാര്യത്തിൽ, മറ്റ് സിസ്റ്റങ്ങൾ സാഹിത്യരേഖകൾ (literature) വായിച്ച് യഥാർത്ഥ തെളിവുകൾ കണ്ടെത്തുകയും, ഊഹങ്ങൾക്ക് പകരം രേഖപ്പെടുത്തപ്പെട്ട വിടവുകൾ (gaps) അടിസ്ഥാനമാക്കി ഗവേഷണ ദിശകൾ നിർദ്ദേശിക്കുകയും ചെയ്യുന്നു. ഇതിന്റെ ഫലമായി പരീക്ഷണത്തിൽ നിന്ന് ഉൾക്കാഴ്ചയിലേക്കുള്ള (insight) സമയം കുറയുന്നു. ബിരുദാനന്തര ബിരുദ വിദ്യാർത്ഥികൾക്കും പ്രിൻസിപ്പൽ ഇൻവെസ്റ്റിഗേറ്റർമാർക്കും ഫോർമാറ്റിംഗിന് പകരം ചിന്തിക്കുന്നതിനായി മണിക്കൂറുകൾ തിരിച്ചുപിടിക്കാനാകും.

ഊഹങ്ങൾക്ക് പകരം ജ്യാമിതീയത ഉപയോഗിച്ച് ഒപ്റ്റിമൈസറുകളെ തിരഞ്ഞെടുക്കാം

Adam-ഉം Lion-ഉം തമ്മിൽ തിരഞ്ഞെടുക്കുന്നത് ഇപ്പോഴും ലാബ് Slack ചാനലുകളിലൂടെ കൈമാറുന്ന ഒരു രഹസ്യവിദ്യ പോലെയാണ് തോന്നുന്നത്. പുതിയ പഠനങ്ങൾ ഒരു ജ്യാമിതീയ വർഗ്ഗീകരണ സംവിധാനം (geometric classification system) ഉപയോഗിച്ച് ഈ പ്രശ്നത്തെ പുനർനിർവചിക്കുന്നു. വീണ്ടും ഒരു സ്വീപ്പിനായി (sweep) GPU സമയം പാഴാക്കുന്നതിന് പകരം, ഒപ്റ്റിമൈസറുകളെ അവയുടെ ജ്യാമിതീയ ഗുണങ്ങൾ ഉപയോഗിച്ച് താരതമ്യം ചെയ്യാനും അവ നിങ്ങളുടെ ലോസ് ലാൻഡ്‌സ്‌കേപ്പുമായി (loss landscape) എങ്ങനെ പ്രതിപ്രവർത്തിക്കുമെന്ന് പ്രവചിക്കാനും നിങ്ങൾക്ക് കഴിയും. ഇത് തിരഞ്ഞെടുപ്പിനെ ഒരു മാന്ത്രികവിദ്യയിൽ നിന്ന് ഒരു രോഗനിർണ്ണയ പ്രക്രിയയാക്കി മാറ്റുന്നു. പ്രായോഗികമായി ചെയ്യുന്നവർക്ക്, ഒപ്റ്റിമൈസറുടെ ജ്യാമിതീയത ഡാറ്റയുടെ ജ്യാമിതീയതയുമായി പൊരുത്തപ്പെടാത്തതിനാൽ പരാജയപ്പെടുന്ന ട്രെയിനിംഗ് റണ്ണുകളുടെ എണ്ണം കുറയ്ക്കാൻ ഇത് സഹായിക്കുന്നു.

പ്രത്യാഘാതങ്ങൾ യഥാർത്ഥത്തിൽ മനസ്സിലാക്കുന്ന വേൾഡ് മോഡലുകൾ

ഒരു റോബോട്ട് അതിന്റെ പാത പ്ലാൻ ചെയ്യുന്നതിന്റെ റെൻഡർ ചെയ്ത വീഡിയോ കാണാൻ മികച്ചതായിരിക്കാം, പക്ഷേ അത് ഒന്നും തെളിയിക്കുന്നില്ല. അതിന്റെ പ്രവർത്തനങ്ങളുടെ ദീർഘകാല പ്രത്യാഘാതങ്ങൾ വേൾഡ് മോഡൽ പ്രവചിക്കുന്നുണ്ടോ എന്നതാണ് യഥാർത്ഥ പരീക്ഷണം. ഇപ്പോൾ ആ പെട്ടി ഉയർത്തുന്നത് പിന്നീട് റോബോട്ടിന്റെ കൈ ഷെൽഫിന് പിന്നിൽ കുടുങ്ങാൻ കാരണമാകുമോ? പുതിയ ബെഞ്ച്മാർക്കുകൾ ദൃശ്യഭംഗി ഒഴിവാക്കി, കാരണവും ഫലവും മുൻകൂട്ടി കാണാനുള്ള (causal foresight) കഴിവിനെ മാത്രം അടിസ്ഥാനമാക്കി മോഡലുകളെ വിലയിരുത്തുന്നു. കാരണം, മനോഹരമായ ഒരു സിമുലേറ്ററിന് തകരാറിലായ സെൻസറുകളോ വീണുപോയ പാലറ്റുകളോ പരിഹരിക്കാൻ കഴിയില്ല. റോബോട്ടിക്സ് വിദഗ്ധർക്ക് ഭൗതിക ലോകത്തിന്റെ വെല്ലുവിളികൾക്ക് അനുയോജ്യമായ മൂല്യനിർണ്ണയം ആവശ്യമാണ്.

വലിയ GPU ചിലവില്ലാതെ ഡിഫ്യൂഷൻ റൺ ചെയ്യാം

ഡിഫ്യൂഷൻ മോഡലുകൾ അതിശയകരമായ ചിത്രങ്ങൾ നിർമ്മിക്കുന്നുണ്ടെങ്കിലും, അവയ്ക്ക് വലിയ കമ്പ്യൂട്ടിംഗ് ചിലവ് ആവശ്യമാണ്. പുതിയ ക്വാണ്ടൈസേഷൻ (quantization) സാങ്കേതികവിദ്യകൾ, വലിയ ഡാറ്റാസെറ്റുകളോ പൂർണ്ണമായ പുനർപരിശീലനമോ (retraining) ഇല്ലാതെ തന്നെ ചെറിയ GPU-കൾക്കായി ഈ വെയ്റ്റുകളെ (weights) കംപ്രസ്സ് ചെയ്യുന്നു. മികച്ച ഗുണനിലവാരത്തിൽ ചെറിയൊരു കുറവ് വരുത്തിക്കൊണ്ട്, ലോക്കലായി പ്രവർത്തിക്കാനോ, നിലവിലുള്ള ഹാർഡ്‌വെയറിൽ കൂടുതൽ ജോലികൾ ചെയ്യാനോ, പ്രീമിയം ക്ലസ്റ്ററുകൾ വാടകയ്ക്ക് എടുക്കാതെ ഇൻഫറൻസ് (inference) നടത്താനോ നിങ്ങൾക്ക് സാധിക്കുന്നു. സ്റ്റുഡിയോകൾക്കും ഇൻഡി ക്രിയേറ്റർമാർക്കും ഇത് ജനറേറ്റീവ് മീഡിയയുടെ സാമ്പത്തിക വശങ്ങളിൽ മാറ്റം വരുത്തുന്നു. വീഡിയോ, ഇമേജ് ജനറേഷൻ എന്നിവയുമായി പരീക്ഷണം നടത്തുന്നതിനുള്ള തടസ്സങ്ങൾ ഗണ്യമായി കുറയുന്നു.

യഥാർത്ഥ പാഠം

ഈ പ്രവർത്തനങ്ങളിലെല്ലാം കാണുന്ന പൊതുവായ പ്രവണത 'ഓപ്പറേഷണലൈസേഷൻ' (operationalization) ആണ്. വലുത് എന്നാൽ മികച്ചത് എന്ന ഘട്ടത്തിൽ നിന്ന് ക