ഈ മാസത്തെ Hugging Face പേപ്പർ റാങ്കിംഗുകൾ ഈ മേഖല വളർന്നുകൊണ്ടിരിക്കുകയാണെന്ന് വെളിപ്പെടുത്തുന്നു. ശ്രദ്ധേയമായ പ്രവൃത്തികൾ കേവലം പാരാമീറ്റർ എണ്ണം വർദ്ധിപ്പിക്കുന്നതിനെക്കാൾ ഉപരിയായി, മോഡലുകളെ കാണാനും ഓർമ്മിക്കാനും അവ തുടങ്ങുന്ന കാര്യങ്ങൾ പൂർത്തിയാക്കാനും പ്രാപ്തമാക്കുന്നതിലാണ് ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്നത്. താഴെ പറയുന്ന പത്ത് പേപ്പറുകൾ റിയൽ-ടൈം വീഡിയോ, റോബോട്ട് കോഗ്നിഷൻ, സത്യസന്ധമായ ബെഞ്ച്മാർക്കിംഗ്, ജനറേറ്ററുകളെ അധ്യാപകരായി പരിഗണിക്കുന്ന നിശബ്ദ വിപ്ലവം എന്നിവയെക്കുറിച്ച് പ്രതിപാദിക്കുന്നു.

നിങ്ങൾക്ക് യഥാർത്ഥത്തിൽ ഉപയോഗിക്കാൻ കഴിയുന്ന റിയൽ-ടൈം വീഡിയോ

മിക്ക വീഡിയോ മോഡലുകളും ഇപ്പോഴും വിലകൂടിയ ലാബ് പരീക്ഷണങ്ങളെപ്പോലെയാണ് പ്രവർത്തിക്കുന്നത്. അവ വലിയ ഹാർഡ്‌വെയറുകളിൽ മിനിറ്റുകളോളം പ്രവർത്തിക്കുകയും, ഇടയിൽ നിയന്ത്രിക്കാൻ കഴിയാത്ത ക്ലിപ്പുകൾ പുറത്തുവിടുകയും ചെയ്യുന്നു. Vidu S1 ഈ സമവാക്യം മാറ്റുന്നു. ഇത് റിയൽ-ടൈം ഇന്ററാക്ഷനെ ലക്ഷ്യമിടുന്നു; TurboDiffusion എന്ന സാങ്കേതികവിദ്യയിലൂടെ സാധാരണ കൺസ്യൂമർ GPU-കളിൽ പ്രവർത്തിക്കുമ്പോൾ തന്നെ, വോയ്‌സ് കമാൻഡുകളിലൂടെ ഡിജിറ്റൽ കഥാപാത്രങ്ങളെ നിയന്ത്രിക്കാൻ ഇത് ഉപയോക്താക്കളെ അനുവദിക്കുന്നു.

ആ ഹാർഡ്‌വെയർ മാറ്റം വളരെ പ്രധാനമാണ്. ഒരു മോഡലിന് ഇനി ഉയർന്ന നിലവാരമുള്ള അക്സിലറേറ്ററുകളുടെ വലിയ ശേഖരം ആവശ്യമില്ലാതാകുമ്പോൾ, അത് വെറുമൊരു ഡെമോ എന്ന നിലയിൽ നിന്ന് ഇൻഫ്രാസ്ട്രക്ചർ ആയി മാറുന്നു. ചാറ്റുകളോട് റിയൽ ടൈമിൽ പ്രതികരിക്കുന്ന ലൈവ് സ്ട്രീമിംഗ് അവതാറുകളെക്കുറിച്ചോ, ആവശ്യാനുസരണം കണ്ണ് കോർത്തുനോക്കുകയും സ്വരം മാറ്റുകയും ചെയ്യുന്ന കസ്റ്റമർ സർവീസ് കഥാപാത്രങ്ങളെക്കുറിച്ചോ ചിന്തിക്കുക. Vidu S1 വെറുമൊരു റിസർച്ച് പ്രീപ്രിന്റ് എന്നതിലുപരി ഒരു ഉൽപ്പന്നമായി വിപണിയിലെത്തുന്ന വീഡിയോ AI-യെയാണ് ചൂണ്ടിക്കാണിക്കുന്നത്.

നിർദ്ദേശങ്ങൾ മനസ്സിലാക്കുന്ന റോബോട്ടുകൾ

ഫിസിക്കൽ AI-യുടെ അടിസ്ഥാനപരമായ തടസ്സമായി നാവിഗേഷൻ ഇപ്പോഴും തുടരുന്നു. സാധാരണ ഭാഷാ നിർദ്ദേശങ്ങളാൽ നയിക്കപ്പെടുന്ന റോബോട്ട് നാവിഗേഷനായി ഒരു ഫൗണ്ടേഷൻ മോഡൽ നിർദ്ദേശിച്ചുകൊണ്ട് ABot-N1 ഇതിനെ നേരിടുന്നു. മുൻകൂട്ടി മാപ്പ് ചെയ്ത വഴികൾക്ക് പകരം, താൻ കാണുന്നതിലും കേൾക്കുന്നതിലും ഉള്ള പാറ്റേണുകൾ തിരിച്ചറിഞ്ഞുകൊണ്ട് വൈവിധ്യമാർന്ന ചുറ്റുപാടുകളിലൂടെ സഞ്ചരിക്കാൻ ഈ സിസ്റ്റം പഠിക്കുന്നു.

ഇതിന്റെ ഉടനടിയുള്ള പ്രയോജനം ലോജിസ്റ്റിക്സ് മേഖലയിലാണ്. "ബൈക്ക് റാക്കിന് അപ്പുറത്തുള്ള സൈഡ് എൻട്രൻസിൽ പാക്കേജ് ഇടുക" എന്നതുപോലുള്ള ഒരു വാക്കാലുള്ള നിർദ്ദേശം ലഭിച്ചാൽ, ഒരു ഡെലിവറി റോബോട്ടിന് ആ നിർദ്ദേശം വിശകലനം ചെയ്യാനും റാക്ക് മാറുമ്പോൾ അതിനനുസരിച്ച് മാറാനും കഴിയും. മുൻകൂട്ടി ഫ്ലോർ പ്ലാനുകൾ അപ്‌ലോഡ് ചെയ്യാതെ തന്നെ അപ്പാർട്ട്മെന്റുകളിലൂടെ സഞ്ചരിക്കാൻ കഴിയുന്ന ഹോം അസിസ്റ്റന്റുകൾക്കും സമാനമായ വഴക്കം ഇതിലൂടെ ലഭിക്കുന്നു.

ഇന്നലത്തെ കാര്യങ്ങൾ ഓർമ്മിച്ചുവെക്കുന്ന റോബോട്ടുകൾ

ABot-AgentOS ആ നാവിഗേഷൻ ജോലിയോടൊപ്പം ചേർന്ന് മറ്റൊരു പ്രശ്നം പരിഹരിക്കുന്നു: റോബോട്ടുകൾ സാധാരണയായി ഓരോ കമാൻഡിന് ശേഷവും റീസെറ്റ് ചെയ്യപ്പെടുന്നു. ഈ സിസ്റ്റം മെഷീനെ ഉപയോക്താക്കൾ, വസ്തുക്കൾ, ദൈനംദിന ശീലങ്ങൾ എന്നിവയെക്കുറിച്ചുള്ള ദീർഘകാല ഓർമ്മയുള്ള ഒരു പെർസിസ്റ്റന്റ് ഏജന്റായി (persistent agent) പരിഗണിക്കുന്നു.

ഒരു വട്ടം മാത്രം പ്രവർത്തിക്കുന്ന പ്രോസസറും തുടർച്ചയായി പ്രവർത്തിക്കുന്ന ഏജന്റും തമ്മിലുള്ള വ്യത്യാസം ഒരു ഉപകരണവും ഒരു സഹപ്രവർത്തകനും തമ്മിലുള്ള വ്യത്യാസം പോലെയാണ്. വെയർഹൗസ് ഓട്ടോമേഷനിൽ, ഓർമ്മശക്തിയുള്ള ഒരു റോബോട്ട് ചൊവ്വാഴ്ചത്തെ ഷിപ്‌മെന്റുകളിൽ എപ്പോഴും പൊട്ടിപ്പോകാൻ സാധ്യതയുള്ള വസ്തുക്കൾ ഉണ്ടെന്ന് മനസ്സിലാക്കുകയും അതിന്റെ പിടുത്തം (grip) ക്രമീകരിക്കുകയും ചെയ്യുന്നു. വീടുകളിലെ പരിചരണത്തിൽ, ഒരു പ്രത്യേക താമസക്കാരൻ ഉച്ചയ്ക്ക് 3 മണിക്ക് ജനൽ കർട്ടനുകൾ പകുതി തുറന്നിടാൻ ഇഷ്ടപ്പെടുന്നു എന്ന് അത് ഓർമ്മിച്ചുവെക്കുന്നു. ഈ തുടർച്ച വലിയ തോതിലുള്ള പേഴ്സണലൈസേഷൻ സാധ്യമാക്കുന്നു.

വീഡിയോ ബെഞ്ച്മാർക്കുകളെ വെല്ലുവിളിക്കുന്നു

Video-Oasis ഒരു അസ്വസ്ഥതയുണ്ടാക്കുന്ന കണ്ടെത്തൽ മുന്നോട്ടുവെക്കുന്നു: പ്രശസ്തമായ പല വീഡിയോ അണ്ടർസ്റ്റാൻഡിംഗ് ബെഞ്ച്മാർക്കുകളും പരാജയപ്പെട്ടിരിക്കുന്നു. മോഡലുകൾ പലപ്പോഴും യഥാർത്ഥ ഫ്രെയിമുകൾ നോക്കാതെ തന്നെ ടെക്സ്റ്റ് അറിവ് മാത്രം ഉപയോഗിച്ച് ചോദ്യങ്ങൾക്ക് ഉത്തരം നൽകുന്നു. നിലവിലെ ബെഞ്ച്മാർക്ക് ചോദ്യങ്ങളിൽ പകുതിയോളം ദൃശ്യങ്ങൾ ഇല്ലാതെ തന്നെ പരിഹരിക്കാൻ കഴിയുമെന്ന് ഈ പേപ്പർ തെളിയിക്കുന്നു.

ഇതിനർത്ഥം ഗവേഷകർ യഥാർത്ഥ കാഴ്ചപ്പാടിനെയല്ല, മറിച്ച് ബുദ്ധിപരമായ ഊഹങ്ങളെയാണ് പ്രോത്സാഹിപ്പിക്കുന്നത് എന്നാണ്. ഓരോ ഉത്തരവും പിക്സൽ തലത്തിലുള്ള തെളിവുകളിൽ അധിഷ്ഠിതമാക്കാൻ മോഡലുകളെ നിർബന്ധിക്കുന്ന മൂല്യനിർണ്ണയ രീതികൾ (evaluation protocols) സമൂഹത്തിന് ആവശ്യമാണ്. അല്ലാത്തപക്ഷം, വെളിച്ചത്തിൽ മാറ്റം വരുമ്പോൾ ആത്മവിശ്വാസത്തോടെ തെറ്റായ കാര്യങ്ങൾ പറയുന്ന (hallucinate) സിസ്റ്റങ്ങൾ വിപണിയിലെത്താൻ സാധ്യതയുണ്ട്.

ദീർഘകാല ജോലികൾ പൂർത്തിയാക്കുന്ന കോഡിംഗ് ഏജന്റുകൾ

കോഡിംഗ് അസിസ്റ്റന്റുകൾ ചെറിയ കോഡ് ഭാഗങ്ങൾ (snippets) നന്നായി എഴുതുന്നുണ്ടെങ്കിലും, നൂറിലധികം ഘട്ടങ്ങളുള്ള DevOps വർക്ക്ഫ്ലോകൾ ഇപ്പോഴും വലിയ വെല്ലുവിളിയാണ്. ഏജന്റുകൾ ദീർഘമായ ജോലികൾ എങ്ങനെ കൈകാര്യം ചെയ്യുന്നുവെന്നും, ഇടയിലുണ്ടാകുന്ന പിശകുകളിൽ നിന്ന് എങ്ങനെ തിരിച്ചു വരുന്നുവെന്നും, മനുഷ്യസഹായമില്ലാതെ എങ്ങനെ വീണ്ടും പ്ലാൻ ചെയ്യുന്നുവെന്നും Long-Horizon-Terminal-Bench പരിശോധിക്കുന്നു.

സ്വയം പ്രവർത്തിക്കുന്ന സിസ്റ്റം അഡ്മിനിസ്ട്രേഷൻ സ്വപ്നം കാണുന്ന ഏതൊരാൾക്കും ഇത് പ്രധാനമാണ്. ഒരു സെർവർ പാച്ച് ചെയ്യാനും, ഡിപെൻഡൻസികൾ പരിശോധിക്കാനും, ഒരു ഘട്ടം പരാജയപ്പെട്ടാൽ പഴയ അവസ്ഥയിലേക്ക് മടങ്ങാനും (roll back) കഴിയുന്ന ഒരു ഏജന്റ്, മികച്ച രീതിയിൽ Python എഴുതുമെങ്കിലും ഒരു API കീ ഇല്ലാത്തപ്പോൾ പണിമുടക്കുന്നതിനേക്കാൾ എത്രയോ മൂല്യമുള്ളതാണ്. ഇത്തരം കഠിനാധ്വാനം ചെയ്യാനുള്ള ശേഷി അളക്കാൻ ഈ ബെഞ്ച്മാർക്ക് ഗവേഷകർക്ക് ഒരു സ്കോർബോർഡ് നൽകുന്നു.

കുറഞ്ഞ ചിലവിലുള്ള റൈൻഫോഴ്‌സ്‌മെന്റ് ലേണിംഗ്

Reinforcement Learning-ലെ ചിലവ് കുറയ്ക്കാൻ Direct OPD ശ്രമിക്കുന്നു. വലിയ മോഡലുകൾക്കായുള്ള RL വലിയ തുകയും GPU സമയവും ചെലവാക്കുന്നു. നിർദ്ദേശിക്കപ്പെട്ട ലളിതമായ വഴി ഇതാണ്: ആദ്യം ഒരു ചെറിയ മോഡലിനെ RL ഉപയോഗിച്ച് പരിശീലിപ്പിക്കുക, തുടർന്ന് ആ പഠിച്ച നയം (policy) ഒരു വലിയ മോഡലിലേക്ക് മാറ്റുക.

ചെറിയ മോഡലുകൾ കുറഞ്ഞ ചിലവിൽ തെറ്റുകൾ പഠിക്കുന്നു. തന്ത്രം ശരിയാണെന്ന് ഉറപ്പുവരുത്തിയ ശേഷം, വലിയ മോഡൽ മുഴുവൻ ചിലവില്ലാതെ തന്നെ ആ പാഠങ്ങൾ സ്വീകരിക്കുന്നു. ലാർജ് ലാംഗ്വേജ് മോഡലുകളെ അലൈൻ ചെയ്യാനോ ഏജന്റുകളെ ഫൈൻ ട്യൂൺ ചെയ്യാനോ ശ്രമിക്കുന്ന ചെറിയ ടീമുകൾക്ക്,