ചൈനയുടെ Orca വേൾഡ് മോഡൽ, ആക്ഷൻ ലേബലുകൾ ഇല്ലാതെ തന്നെ സ്പെഷ്യലൈസ്ഡ് റോബോട്ടിക്സിനോട് കിടപിടിക്കുന്നു

ചൈനയിലെ ഗവേഷകർ നടത്തിയ ഒരു പുതിയ മുന്നേറ്റം, നേരിട്ടുള്ള മേൽനോട്ടം ഇല്ലാതെ തന്നെ ഒരു ഏകീകൃത വേൾഡ് മോഡലിന് റോബോട്ടിക്സിൽ പ്രാവീണ്യം നേടാൻ കഴിയുമെന്ന് തെളിയിച്ചുകൊണ്ട് AI ബുദ്ധിശക്തിയുടെ അടിസ്ഥാന നിർവചനത്തെ വെല്ലുവിളിക്കുന്നു. വീഡിയോകളിലൂടെ ലോകം എങ്ങനെ മാറുന്നു എന്ന് നിരീക്ഷിക്കുന്നതിലൂടെ, സങ്കീർണ്ണമായ ശാരീരിക പ്രവർത്തനങ്ങൾ നിയന്ത്രിക്കാൻ ശേഷിയുള്ള ആഴത്തിലുള്ള ആന്തരിക ധാരണ ഒരു AI-ക്ക് വികസിപ്പിക്കാൻ കഴിയുമെന്ന് Orca മോഡൽ കാണിച്ചുതരുന്നു.

ഡ്യുവൽ-ലേണിംഗ് എൻജിൻ: അൺകോൺഷ്യസ് (Unconscious), കോൺഷ്യസ് (Conscious) മോഡുകൾ

അതിന്റെ ആന്തരിക "വേൾഡ് സ്റ്റേറ്റ്" (world state) നിർമ്മിക്കുന്നതിനായി രണ്ട് രീതിയിലുള്ള പരിശീലന സമീപനം ഉപയോഗിക്കുന്നതിലൂടെ Orca പരമ്പരാഗത സ്പെഷ്യലൈസ്ഡ് മോഡലുകളിൽ നിന്ന് വ്യത്യസ്തമായി പ്രവർത്തിക്കുന്നു. ആദ്യത്തെ രീതിയായ "അൺകോൺഷ്യസ് ലേണിംഗ്" (unconscious learning), ലേബൽ ചെയ്യാത്ത 1,25,000 മണിക്കൂർ വീഡിയോകൾ പ്രോസസ്സ് ചെയ്യുന്നതാണ്. ഈ ഘട്ടത്തിൽ, മോഡൽ ഒരു അബ്‌സ്‌ട്രാക്റ്റ് സ്പേസിൽ ഭാവിയിലെ ഫ്രെയിമുകൾ പ്രവചിക്കുന്നു, ഇത് ഒരു ക്യാപ്ഷനും ഇല്ലാതെ തന്നെ ചലന രീതികൾ (motion patterns), വസ്തുക്കളുടെ മറയ്ക്കപ്പെടൽ (object occlusions), സീൻ ഡൈനാമിക്സ് എന്നിവ മനസ്സിലാക്കാൻ സഹായിക്കുന്നു.

രണ്ടാമത്തെ രീതിയായ "കോൺഷ്യസ് ലേണിംഗ്" (conscious learning), വാക്കാലുള്ള നിർദ്ദേശങ്ങളും വിവരണങ്ങളും ഉൾപ്പെടുത്തുന്നു. വീഡിയോകൾ കഷണങ്ങളായി തിരിക്കുകയും resulting state changes ലേബൽ ചെയ്യുകയും ചെയ്യുന്നതിലൂടെ, ഒരു പ്രത്യേക പ്രവൃത്തിയും അതിന്റെ ശാരീരിക ഫലവും തമ്മിലുള്ള കാരണ-ഫല ബന്ധം (causal relationship) Orca പഠിക്കുന്നു. ഈ സംയോജനം, പച്ചയായ വിഷ്വൽ പെർസെപ്ഷനും (visual perception) ഉയർന്ന തലത്തിലുള്ള ഭാഷാപരമായ യുക്തിക്കും (linguistic reasoning) ഇടയിലുള്ള വിടവ് നികത്താൻ മോഡലിനെ സഹായിക്കുന്നു.

മാറ്റം വരുത്താവുന്ന ഇന്റലിജൻസ് മോഡ്യൂളുകളോടു കൂടിയ ഒരു ഫ്രോസൺ കോർ (Frozen Core)

Orca-യുടെ ആർക്കിടെക്ചർ അതീവ വൈവിധ്യമാർന്ന പ്രവർത്തനങ്ങൾക്കായി രൂപകൽപ്പന ചെയ്തിട്ടുള്ളതാണ്. ഇത് പ്രീ-ട്രെയിൻ ചെയ്ത Qwen3.5 ലാംഗ്വേജ്-ഇമേജ് മോഡലിനെ ഒരു "ഫ്രോസൺ കോർ" (frozen core) ആയി ഉപയോഗിക്കുന്നു. ഓരോ ജോലിക്കും വേണ്ടി മുഴുവൻ സിസ്റ്റവും വീണ്ടും പരിശീലിപ്പിക്കുന്നതിന് പകരം, ഗവേഷകർ ഈ സ്ഥിരമായ അടിത്തറയിലേക്ക് സ്പെഷ്യലൈസ്ഡ് ആയ, ഭാരം കുറഞ്ഞ "ഹെഡുകൾ" (heads) ഘടിപ്പിക്കുന്നു:

  • ടെക്സ്റ്റ് ഔട്ട്പുട്ട്: നിലവിലുള്ള Qwen3.5 ലാംഗ്വേജ് ഹെഡ് ഉപയോഗിക്കുന്നു.
  • ഇമേജ് ജനറേഷൻ: ആന്തരിക വേൾഡ് സ്റ്റേറ്റിനെ വിഷ്വൽ പ്രവചനങ്ങളാക്കി മാറ്റുന്നതിനായി Stable Diffusion 3.5-മായി ബന്ധിപ്പിച്ച ചെറിയ അഡാപ്റ്ററുകൾ ഉപയോഗിക്കുന്നു.
  • റോബോട്ട് കൺട്രോൾ: വേൾഡ് സ്റ്റേറ്റുകളെ ശാരീരിക ചലനങ്ങളാക്കി മാറ്റാൻ പ്രത്യേകം പരിശീലിപ്പിച്ച കസ്റ്റം നിർമ്മിത "Action Expert" മോഡ്യൂൾ ഉപയോഗിക്കുന്നു.

മോഡൽ ഒരു ചോദ്യത്തിന് ഉത്തരം നൽകുകയോ, ഒരു വീഡിയോ നിർമ്മിക്കുകയോ, അല്ലെങ്കിൽ ഒരു മെക്കാനിക്കൽ ആം നിയന്ത്രിക്കുകയോ ചെയ്യട്ടെ, ലോകത്തെക്കുറിച്ചുള്ള അതിന്റെ കേന്ദ്രപരമായ ധാരണ സ്ഥിരമായിരിക്കുമെന്ന് ഈ മോഡുലാരിറ്റി ഉറപ്പാക്കുന്നു.

സ്പെഷ്യലൈസ്ഡ് മോഡലുകളെയും ഭീമൻമാരെയും മറികടക്കുന്നു

Orca-4B-യുടെ പ്രകടന സൂചകങ്ങൾ ശ്രദ്ധേയമാണ്. ടെക്സ്റ്റ് അധിഷ്ഠിത വീഡിയോ ബെഞ്ച്മാർക്കുകളിൽ, Orca-4B ശരാശരി 51.8 ശതമാനം കൈവരിച്ചു, ഇത് Emu3 (34B) പോലുള്ള വലിയ മോഡലുകളെയും DeepSeek-VL2-3B പോലുള്ള സ്പെഷ്യലൈസ്ഡ് VLMs-നെയും മറികടക്കുന്നു. PRICE-V0.1 ബെഞ്ച്മാർക്ക് വഴിയുള്ള ഇമേജ് പ്രെഡിക്ഷൻ ടാസ്ക്കുകളിൽ, Orca-4B 59.8 ശതമാനം സ്കോർ ചെയ്തു, ഇത് FLUX.2 small പോലുള്ള ഹൈ-എൻഡ് ജനറേറ്ററുകളെക്കാൾ മികച്ചതാണ്.

ഏറ്റവും ശ്രദ്ധേയമായ കാര്യം, ബൗളുകൾ അടുക്കി വെക്കുക, പഞ്ചസാര കോരിയെടുക്കുക തുടങ്ങിയ അഞ്ച് മാനിപുലേഷൻ ടാസ്ക്കുകളിൽ (manipulation tasks), റോബോട്ടിക് ആക്ഷൻ ഡാറ്റയിൽ മാത്രം നിർമ്മിച്ച $\pi$0.5 എന്ന സിസ്റ്റത്തിന് തുല്യമായ പ്രകടനം Orca കാഴ്ചവെക്കുന്നു എന്നതാണ്. ഏറ്റവും പ്രധാനമായി, അതിന്റെ വൻതോതിലുള്ള പ്രീ-ട്രെയിനിംഗ് ഘട്ടത്തിൽ ഒരു ആക്ഷൻ ലേബലും കാണാതെയാണ് Orca ഇത് നേടിയത്. സ്പെഷ്യലൈസ്ഡ് മോഡലുകൾ പലപ്പോഴും ആവർത്തന ലൂപ്പുകളിൽ കുടുങ്ങിപ്പോകുന്നിടത്ത്, പരാജയപ്പെട്ട ഗ്രാസ്പുകൾ (grasps) വീണ്ടും ശ്രമിച്ചുകൊണ്ട് മികച്ച എറർ റിക്കവറി (error recovery) പോലും Orca പ്രകടിപ്പിച്ചു.

എന്തുകൊണ്ട് ഇത് AI-യുടെ ഭാവിക്ക് പ്രധാനമാണ്

ആധുനിക റോബോട്ടിക്സിലെ ഏറ്റവും വലിയ തടസ്സങ്ങളിലൊന്നിനെ Orca പരിഹരിക്കുന്നു: ലേബൽ ചെയ്ത ആക്ഷൻ ഡാറ്റയുടെ കടുത്ത കുറവ്. നിഷ്ക്രിയമായ നിരീക്ഷണത്തിലൂടെ (passive observation) ഒരു AI-ക്ക് "ലോകത്തിന്റെ ഭൗതികശാസ്ത്രം" (physics of the world) പഠിക്കാൻ കഴിയുമെന്ന് തെളിയിക്കുന്നതിലൂടെ, ദശലക്ഷക്കണക്കിന് മണിക്കൂർ നീളുന്ന മാനുവൽ, ഹാൻഡ്-ലേബൽഡ് ടെലിഓപ്പറേഷൻ ഡാറ്റ ആവശ്യമില്ലാതെ തന്നെ പുതിയ സാഹചര്യങ്ങളിൽ വിന്യസിക്കാൻ കഴിയുന്ന ജനറൽ-പർപ്പസ് റോബോട്ടുകൾക്കായി ഈ ഗവേഷണം വഴിതുറക്കുന്നു.

പ്രധാന കാര്യങ്ങൾ

  • അൺസൂപ്പർവൈസ്ഡ് ഫൗണ്ടേഷൻ: ലേബൽ ചെയ്യാത്ത വീഡിയോകളുടെ "അൺകോൺഷ്യസ് ലേണിംഗ്" വഴി Orca ലോകത്തിന്റെ ഡൈനാമിക്സ് പഠിക്കുന്നു, ഇത് ചെലവേറിയ ഹ്യൂമൻ-അനോട്ടേറ്റഡ് ഡാറ്റാസെറ്റുകളെ ആശ്രയിക്കുന്നത് കുറയ്ക്കുന്നു.
  • മോഡുലാർ ആർക്കിടെക്ചർ: മാറ്റം വരുത്താവുന്ന അഡാപ്റ്ററുകളോടു കൂടിയ ഒരു ഫ്രോസൺ Qwen3.5 കോർ ഉപയോഗിക്കുന്നത് ഒരു മോഡലിന് ടെക്സ്റ്റ്, ഇമേജ്, റോബോട്ടിക് കൺട്രോൾ എന്നിവയിൽ ഒരേസമയം മികവ് പുലർത്താൻ അനുവദിക്കുന്നു.
  • റോബോട്ടിക് പാരറ്റി: പ്രീ-ട്രെയിനിംഗ് സമയത്ത് ആക്ഷൻ ലേബലുകളെക്കുറിച്ച് മുൻകൂട്ടി അറിയാതിരുന്നിട്ടും, മാനിപുലേഷൻ ടാസ്ക്കുകളിൽ Orca-4B സ്പെഷ്യലൈസ്ഡ് റോബോട്ടിക് സിസ്റ്റങ്ങളുടെ പ്രകടനത്തിന് തുല്യമായ ഫലം നൽകുന്നു.