Anthropic-ന്റെ Fable 5 മോഡൽ, ഗെയിമിന്റെ വിഷ്വൽ ഔട്ട്പുട്ട് മാത്രം ഉപയോഗിച്ച് ചൈനീസ് ഭാഷയിലുള്ള Pokémon FireRed കളിച്ചപ്പോൾ 1,785 ടേണുകളിൽ ആദ്യത്തെ ജിം ബാഡ്ജ് നേടി, ഇതിനായി 65.40 ഡോളർ ചിലവായി. ടെക്സ്റ്റ് പ്രോംപ്റ്റുകൾ ഇല്ലാതെ തന്നെ ഗെയിമിന്റെ ഒരു ഭാഗം പൂർത്തിയാക്കാൻ മോഡലിന് കഴിയുമെന്ന് ഈ പരീക്ഷണം തെളിയിക്കുന്നുണ്ടെങ്കിലും, മോഡലിന്റെ 'thinking chain' പരിശോധിച്ചാൽ അത് ഓരോ പിക്സലുകളെയും ശരിക്കും "കാണുന്നതിനോ" അവയെക്കുറിച്ച് ചിന്തിക്കുന്നതിനോ പകരം, മുൻകൂട്ടി പഠിച്ച ഗെയിം വിവരങ്ങൾ മനഃപാഠമാക്കി പറയുകയായിരുന്നു എന്ന് മനസ്സിലാക്കാം.
Anthropic-ന്റെ അവകാശവാദം പരീക്ഷിക്കപ്പെടുന്നു
Anthropic, Fable 5 പുറത്തിറക്കിയപ്പോൾ, സ്ക്രീൻ മാത്രം നോക്കി Pokémon FireRed നിയന്ത്രിക്കാൻ കഴിയുന്ന ഒരു "vision-only" ഡെമോ കമ്പനി അവതരിപ്പിച്ചു. ഏത് വിഷ്വൽ സാഹചര്യത്തെയും അടിസ്ഥാനത്തിൽ നിന്ന് തന്നെ വ്യാഖ്യാനിക്കാൻ സിസ്റ്റത്തിന് കഴിയുമെന്ന് ഈ വാർത്തകൾ തോന്നിപ്പിച്ചു. Anthropic-ന്റെ ലോഞ്ച് പേജിൽ വിവരിച്ചിരിക്കുന്ന രീതിയിൽ തന്നെ സെറ്റപ്പ് തയ്യാറാക്കി, ഗെയിമിന്റെ ചൈനീസ് പതിപ്പിൽ മോഡൽ പ്രവർത്തിപ്പിച്ചുകൊണ്ട് ഒരു ഡെവലപ്പർ ഈ അവകാശവാദം പരിശോധിക്കാൻ തീരുമാനിച്ചു.
പരീക്ഷണം എങ്ങനെയാണ് നടത്തിയത്
ഒരു കസ്റ്റം ഹാർനസ് (harness) ഉപയോഗിച്ച് മോഡലിന് വീഡിയോ ഫ്രെയിമുകൾ നൽകുകയും അതിന്റെ പ്രവർത്തനങ്ങൾ (action choices) രേഖപ്പെടുത്തുകയും ചെയ്തു. Anthropic വിവരിച്ചതുപോലെ തന്നെ, ഓരോ പുതിയ ഫ്രെയിമും മോഡലിന് നൽകുകയും തിരഞ്ഞെടുത്ത കൺട്രോളർ ഇൻപുട്ടുകൾ വായിച്ചെടുക്കുകയും ചെയ്യുന്ന രീതിയിലായിരുന്നു ഇത്. മോഡൽ ആദ്യത്തെ ജിം ബാഡ്ജ് നേടുന്നത് വരെ ഗെയിം ലൂപ്പ് തുടർന്നു, തുടർന്ന് അバター (avatar) Route 3-ൽ എത്തുന്നതുവരെയുള്ള 2,000-ാം ടേൺ വരെ പരീക്ഷണം നീണ്ടുനിന്നു.
ഇതിന്റെ അളവ്പരമായ ഫലം (quantitative outcome) വ്യക്തമായിരുന്നു:
- 1,785 ടേണുകൾക്ക് ശേഷം ആദ്യത്തെ ജിം ബാഡ്ജ് നേടി
- ആകെ കമ്പ്യൂട്ട് ചിലവ് $65.40
- 2,000-ാം ടേണിൽ അバター Route 3-ൽ എത്തി
ലോഗുകൾ വെളിപ്പെടുത്തുന്നത് എന്താണ്
എന്നാൽ, മോഡൽ എങ്ങനെയാണ് അവിടെ എത്തിയത് എന്നതിനെക്കുറിച്ച് ലോഗുകൾ മറ്റൊരു കഥയാണ് പറയുന്നത്. മോഡലിന്റെ ആന്തരികമായ "thinking chain", സ്ക്രീനിൽ ഇതുവരെ പ്രത്യക്ഷപ്പെടാത്ത വിവരങ്ങൾ ആവർത്തിച്ച് രേഖപ്പെടുത്തിക്കൊണ്ടിരുന്നു.
- 78-ാം ടേണിൽ, എതിരാളി (rival) ഏത് പോക്കിമോണിനെ തിരഞ്ഞെടുക്കുമെന്ന് ഗെയിം കാണിക്കുന്നതിന് മുമ്പ് തന്നെ മോഡൽ 'Charmander' എന്ന് രേഖപ്പെടുത്തി.
- 141 ടേണുകൾക്ക് ശേഷം, ഗെയിം ഒടുവിൽ 'Oak’s Parcel' നൽകിയപ്പോൾ, മോഡൽ ആ ഐറ്റത്തിന്റെ പേര് നേരത്തെ തന്നെ അതിന്റെ കുറിപ്പുകളിൽ രേഖപ്പെടുത്തിയിരുന്നു.
- Route 3 travers ചെയ്യുമ്പോൾ, വിഷ്വൽ ഫീഡിൽ ഒരിക്കലും വരാത്ത ഒരു പ്രശസ്തമായ ഡയലോഗ് ഉദ്ധരിച്ചുകൊണ്ട് മോഡൽ ഒരു പ്രത്യേക ട്രെയിനറെ തിരിച്ചറിഞ്ഞു.
ഈ വിവരങ്ങൾ പിക്സൽ അടിസ്ഥാനത്തിലുള്ള വിശകലനത്തിന്റെ ഫലമല്ല. പകരം, ഗെയിമിന്റെ വിശദമായ സ്ക്രിപ്റ്റ് മനഃപാഠമാക്കിയ ഒരു സിസ്റ്റത്തിന്റെ അടയാളങ്ങളാണിവ—ഇന്റർനെറ്റിൽ ലഭ്യമായ വാക്ക്ത്രൂകൾ (walkthroughs), വിക്കികൾ (wikis), ഫാൻ വീഡിയോകൾ എന്നിവയിൽ കാണുന്ന അറിവ് തന്നെയാണിത്. മറ്റൊരു വിധത്തിൽ പറഞ്ഞാൽ, തനിക്ക് നേരത്തെ അറിയാവുന്ന ഒരു മാപ്പ് സ്ഥിരീകരിക്കാൻ വേണ്ടി മാത്രമാണ് മോഡൽ കാഴ്ചാശക്തി (vision) ഉപയോഗിക്കുന്നത് എന്ന് തോന്നുന്നു.
വിഷ്വൽ-റീസണിംഗ് ബെഞ്ച്മാർക്കുകളെ ഇത് എന്തിന് ബാധിക്കുന്നു
പല വിഷ്വൽ-റീസണിംഗ് ടെസ്റ്റുകളിലും കാണപ്പെടുന്ന സൂക്ഷ്മവും എന്നാൽ നിർണ്ണായകവുമായ ഒരു പോരായ്മയെ ഈ പരീക്ഷണം ചൂണ്ടിക്കാണിക്കുന്നു:
- വ്യക്തമായ ഇൻപുട്ട് (Clean input) എന്നാൽ കൃത്യമായ അറിവ് (clean knowledge state) എന്ന് അർത്ഥമില്ല. ഇമേജ് സ്ട്രീം മാത്രമാണ് ലഭിക്കുന്നതെങ്കിൽ പോലും, മോഡൽ നേരത്തെ പഠിച്ചെടുത്ത വൻതോതിലുള്ള വിവരങ്ങൾ ഉപയോഗിച്ചേക്കാം.
- സിസ്റ്റം പ്രോംപ്റ്റുകൾക്ക് ട്രെയിനിംഗ് ഡാറ്റയെ മായ്ച്ചുകളയാനാവില്ല. ഒരു ഗെയിമിന്റെ പൂർണ്ണമായ വാക്ക്ത്രൂ കണ്ട മോഡലിനെ, വീണ്ടും ട്രെയിൻ ചെയ്യാതെ തന്നെ അത് "മറക്കാൻ" നിർബന്ധിക്കാൻ കഴിയില്ല.
- പ്രകടനം അളക്കുന്നത് ഓർമ്മശക്തിയാകാം, കാഴ്ചപ്പാടല്ല (perception). ടെസ്റ്റ് ചെയ്യുന്ന ലോകം നേരത്തെ അറിയാവുന്ന ഡാറ്റാസെറ്റുമായി പൊരുത്തപ്പെടുന്നുണ്ടെങ്കിൽ, പുതിയ വിഷ്വൽ വിവരങ്ങൾ വിശകലനം ചെയ്യുന്നതിന് പകരം പാറ്റേണുകൾ തമ്മിൽ പൊരുത്തപ്പെടുത്തിക്കൊണ്ട് മോഡലിന് വിജയിക്കാൻ സാധിക്കും.
ബെഞ്ച്മാർക്കുകൾ "vision-only" എന്നത് വിഷ്വൽ റീസണിംഗിന്റെ പകരക്കാരനായി (proxy) കണക്കാക്കുന്നത് തുടർന്നാൽ, പുതിയ സാഹചര്യങ്ങൾ മനസ്സിലാക്കാനുള്ള AI-യുടെ കഴിവിനെക്കുറിച്ച് അമിതമായി അവകാശവാദം ഉന്നയിക്കാൻ അത് കാരണമാകും. അടിസ്ഥാനപരമായ കഴിവുകൾ പരിമിതമായിരിക്കുമ്പോഴും കമ്പനികൾ ആകർഷകമായ കണക്കുകൾ നിരത്താൻ ഇത് ഇടയാക്കും—ഇൻവെസ്റ്റർമാർക്കും ഡെവലപ്പർമാർക്കും യഥാർത്ഥത്തിൽ പുതിയ സാഹചര്യങ്ങളിൽ പ്രവർത്തിക്കേണ്ട സുരക്ഷാപ്രധാനമായ (safety-critical) സിസ്റ്റങ്ങൾ നിർമ്മിക്കുന്നവർക്കും ഈ പ്രശ്നം വളരെ പ്രധാനമാണ്.
എതിർവാദം: മനഃപാഠമാക്കുന്നത് ശരിക്കും ഒരു പ്രശ്നമാണോ?
അറിയപ്പെടുന്ന ഒരു മാപ്പ് സ്ഥിരീകരിക്കുന്നതിന് പോലും ഒരുതരം റീസണിംഗ് ആവശ്യമാണെന്ന് ചിലർ വാദിക്കുന്നു: മോഡൽ അതിന്റെ ആന്തരികമായ വിവരങ്ങളെ നിലവിലെ വിഷ്വൽ സൂചനകളുമായി പൊരുത്തപ്പെടുത്തേണ്ടതുണ്ട്. ആ കാഴ്ചപ്പാടിൽ, നിലവിലുള്ള അറിവിനെ വിഷ്വൽ വിവരങ്ങളുമായി ബന്ധിപ്പിക്കാൻ (grounding) കാഴ്ചാശക്തി ഉപയോഗിക്കുന്നു എന്നതുകൊണ്ട് ഈ ഡെമോ ഒരു ഉപയോഗപ്രദമായ കഴിവ് പ്രകടിപ്പിക്കുന്നുണ്ട്. ഈ വാദം ശരിയാണ്; ഈ ടാസ്കിൽ ഒരു പെർസെപ്ച്വൽ ചെക്ക് (perceptual check) ഉൾപ്പെടുന്നുണ്ട്.
എന്നിരുന്നാലും, ഒരു സ്റ്റോർ ചെയ്ത സ്ക്രിപ്റ്റ് വീണ്ടെടുക്കുന്നതിനെക്കാൾ ഉപരിയായി, പൊതുവായ (general) വിഷ്വൽ ഇൻഫറൻസ് (visual inference) വിലയിരുത്തുക എന്നതാണ് ബെഞ്ച്മാർക്കിന്റെ പ്രധാന ലക്ഷ്യം. സംഭവങ്ങൾ നടப்பதற்கு മുമ്പ് തന്നെ മോഡലിന് അവ പ്രവചിക്കാൻ കഴിയുമെങ്കിൽ, ആ പരീക്ഷണം കാഴ്ചപ്പാടിനെ (perception) മാത്രം അളക്കുന്ന ഒന്നല്ലാതാകുന്നു. ഉപയോഗപ്രദമായ ഗ്രൗണ്ടിംഗും (grounding) കൃത്രിമമായ ചീറ്റിംഗും തമ്മിലുള്ള വ്യത്യാസം അവ്യക്തമാവുകയും, ഫലങ്ങൾ അതിന്റെ യഥാർത്ഥ മൂല്യം നഷ്ടപ്പെടുകയും ചെയ്യുന്നു.
അടുത്ത ഘട്ടങ്ങളും കമ്മ്യൂണിറ്റി പ്രതികരണവും
മനഃപാഠമാക്കാനുള്ള കഴിവിന്റെ പരിധികൾ പരീക്ഷിക്കുന്നതിനായി, ടെസ്റ്റർ ഇപ്പോൾ ഭൂമിശാസ്ത്രപരമായ മാറ്റങ്ങൾ വരുത്തിയ ഒരു പരിഷ്കരിച്ച മാപ്പിൽ അതേ മോഡൽ തന്നെ പ്രവർത്തിപ്പിക്കുകയാണ്. ഈ പരീക്ഷണം ആവർത്തിക്കാനോ അല്ലെങ്കിൽ മറ്റ് ഗെയിമുകളിൽ പ്രയോഗിക്കാനോ മറ്റ് ഗവേഷകരെ ക്ഷണിച്ചുകൊണ്ട്, എല്ലാ കോഡുകളും, കസ്റ്റം ഹാർനെസ്സും, പൂർണ്ണമായ ലോഗ് ഫയലുകളും പരസ്യമാക്കിയിട്ടുണ്ട്. തുടർച്ചയായ സംവാദങ്ങൾക്കായി ഒരു ലേണിംഗ് കമ്മ്യൂണിറ്റി പ്ലാറ്റ്ഫോമിൽ ഒരു ചർച്ചാ ചാനലും തുറന്നിട്ടിട്ടുണ്ട്.
പ്രധാന പാഠം
മോഡലിന് ഉത്തരം നേരത്തെ അറിയാവുന്നത് കൊണ്ട് മാത്രം വിജയിക്കുന്ന ഒരു വിഷൻ-ഒൺലി ഡെമോ, യഥാർത്ഥ വിഷ്വൽ റീസണിംഗിന്റെ തെളിവല്ല. ബെഞ്ച്മാർക്കുകൾ മനഃപാഠമാക്കിയ അറിവിനെയും തത്സമയ കാഴ്ചപ്പാടിനെയും (on-the-fly perception) വേർതിരിക്കണം; അല്ലാത്തപക്ഷം, തികച്ചും അപരിചിതമായ വിഷ്വൽ ലോകങ്ങളെ കൈകാര്യം ചെയ്യാനുള്ള AI-യുടെ കഴിവിനെ അത് അമിതമായി കാണിക്കാൻ ഇടയാക്കും.
