നമ്മൾ സാധാരണയായി ലാർജ് ലാംഗ്വേജ് മോഡലുകളെ (LLMs) അസാധാരണ വേഗതയുള്ള ലൈബ്രേറിയന്മാരായാണ് സങ്കൽപ്പിക്കാറുള്ളത്. നിങ്ങൾ ഒരു ചോദ്യം ചോദിക്കുമ്പോൾ, ഏറ്റവും അനുയോജ്യമായ പാറ്റേൺ കണ്ടെത്താനായി അവ കോടിക്കണക്കിന് ഓർമ്മിച്ചുവെച്ച ഭാഗങ്ങളിലൂടെ അതിവേഗം സഞ്ചരിക്കുന്നു. ഈ സങ്കൽപ്പം ഡെവലപ്പർമാർ പ്രോംപ്റ്റുകൾ നിർമ്മിക്കുന്ന രീതിയെയും, ഉപയോക്താക്കൾ പ്രതീക്ഷകൾ രൂപപ്പെടുത്തുന്നതിനെയും, റെഗുലേറ്റർമാർ നിയമങ്ങൾ തയ്യാറാക്കുന്നതിനെയും സ്വാധീനിച്ചിട്ടുണ്ട്. എന്നാൽ Anthropic-ന്റെ Claude-നെ കുറിച്ചുള്ള ഗവേഷണങ്ങൾ ഈ കാഴ്ചപ്പാടിനെ സങ്കീർണ്ണമാക്കുകയാണ്. ഈ മോഡൽ യഥാർത്ഥമായ യുക്തിചിന്തയോട് (reasoning) അടുത്ത എന്തോ ആണ് ചെയ്യുന്നത് എന്ന് കാണപ്പെടുന്നു. ഗവേഷകർ ഈ സംവിധാനത്തെ "j-space reasoning" എന്ന് വിളിക്കുന്നു; ഇത് വെറുതെ ട്രെയിനിംഗ് ഡാറ്റ ഉപയോഗിക്കുന്നതിന് പകരം ആശയങ്ങളുടെ ആന്തരിക മാതൃകകൾ (internal models) Claude നിർമ്മിക്കുന്നു എന്നാണ് സൂചിപ്പിക്കുന്നത്. ഈ കണ്ടെത്തൽ ശരിയാണെങ്കിൽ, അത്യാധുനിക AI-കളെ വെറുമൊരു പ്രെഡിക്റ്റീവ് ടെക്സ്റ്റ് എഞ്ചിനായി കാണുന്നത് അവസാനിപ്പിക്കേണ്ടി വരും, പകരം ഒരു പ്ലാനിംഗ് സിസ്റ്റമായി അവയെ കാണാൻ നമ്മൾ തുടങ്ങണം.

പാറ്റേൺ മാച്ചിംഗിൽ നിന്ന് മെന്റൽ മോഡലുകളിലേക്ക്

J-space reasoning എന്നത് വെറുമൊരു മാർക്കറ്റിംഗ് വാഗ്ദാനമല്ല. ഉപരിപ്ലവമായ ആവർത്തനത്തിൽ നിന്ന് ആന്തരികമായ പ്രതിനിധീകരണത്തിലേക്കുള്ള (internal representation) ഒരു ഘടനാപരമായ മാറ്റത്തെയാണ് ഇത് വിവരിക്കുന്നത്. ഒരാൾ ഒരു ജിഗ്‌സോ പസിൽ എങ്ങനെ പരിഹരിക്കുന്നു എന്ന് ചിന്തിക്കുക. അവർ ഓരോ കഷണവും ഓരോ ഒഴിവുകളിലും വെച്ച് പരീക്ഷിക്കാറില്ല. അവർ ബോക്സിലെ ചിത്രം നോക്കുന്നു, നിറങ്ങളുടെയും വശങ്ങളുടെയും ഒരു മാനസിക മാപ്പ് (mental map) നിർമ്മിക്കുന്നു, ആ പ്ലാൻ അനുസരിച്ച് ഓരോ കഷണവും വെക്കുന്നു. Claude-നെ കുറിച്ചുള്ള ഗവേഷണം സൂചിപ്പിക്കുന്നത്, മോഡൽ അബ്സ്ട്രാക്റ്റ് ആശയങ്ങൾ പ്രോസസ്സ് ചെയ്യുമ്പോൾ സമാനമായ ഒന്ന് സംഭവിക്കുന്നു എന്നാണ്. അത് പ്രശ്നത്തിന്റെ ഒരു വർക്കിംഗ് മോഡൽ നിർമ്മിക്കുകയും ബോധപൂർവ്വം അതിലൂടെ സഞ്ചരിക്കുകയും ചെയ്യുന്നു.

പരമ്പരാഗത ലാംഗ്വേജ് മോഡലുകൾ കോറിലേഷനിൽ (correlation) മികവ് പുലർത്തിയിട്ടുണ്ട്. "king" എന്നത് പലപ്പോഴും "queen" എന്ന വാക്കിന് അടുത്ത് വരുന്നുണ്ടെന്നും, ഒരു ഫംഗ്ഷൻ കോളിന് ശേഷം സാധാരണയായി ഏത് കോഡ് വരുന്നുണ്ടെന്നും അവയ്ക്ക് അറിയാം. കോറിലേഷൻ ശക്തമാണ്, പക്ഷേ അത് അറിവല്ല (understanding). J-space reasoning വ്യത്യസ്തമായ ഒന്നിനെയാണ് ചൂണ്ടിക്കാണിക്കുന്നത്: വാക്കുകൾ എങ്ങനെ കൂട്ടിച്ചേർക്കപ്പെടുന്നു എന്ന് പ്രവചിക്കുന്നതിന് പകരം, ആശയങ്ങൾ തമ്മിലുള്ള ബന്ധങ്ങളെ കൈകാര്യം ചെയ്യാനാണ് മോഡൽ ശ്രമിക്കുന്നത്. അത് ഒരു ആന്തരിക ചട്ടക്കൂട് (internal scaffolding) രൂപപ്പെടുത്തുകയും, ഒരു ഉത്തരത്തിൽ എത്തിച്ചേരാൻ ആ ചട്ടക്കൂട് ഉപയോഗിക്കുകയും ചെയ്യുന്നു.

പ്രായോഗികമായി J-Space Reasoning എന്ത് മാറ്റം വരുത്തുന്നു

ഈ മാറ്റം യഥാർത്ഥ ലോക ഉപയോഗത്തിന് പ്രസക്തമായ മൂന്ന് പ്രായോഗിക കഴിവുകൾ നൽകുന്നു.

Compositionality. നമ്മൾ കണ്ടിട്ടില്ലാത്ത ഒരു "purple flying elephant"നെ കുറിച്ച് മനുഷ്യർക്ക് മനസ്സിലാക്കാൻ സാധിക്കും, കാരണം നമ്മൾ അറിയാവുന്ന ആശയങ്ങളെ കൂട്ടിച്ചേർക്കുന്നു. ഗവേഷണ പ്രകാരം, Claude സമാനമായ രീതിയിൽ പുതിയ കോമ്പിനേഷനുകൾ കൈകാര്യം ചെയ്യുന്നു. ഇതിനോട് ഇതുവരെ ജോഡി ചേർക്കപ്പെടാത്ത രണ്ട് മേഖലകളെ കൂട്ടിച്ചേർക്കുന്ന ഒരു പ്രശ്നം അവതരിപ്പിച്ചാൽ—ഉദാഹരണത്തിന്, എവല്യൂഷണറി ബയോളജിയിലെ തത്വങ്ങൾ ഉപയോഗിച്ച് ഒരു സപ്ലൈ ചെയിൻ ഒപ്റ്റിമൈസ് ചെയ്യുന്നത്—അത് വെറുമൊരു പൊതുവായ ഉപദേശത്തിന് പകരം ആ ആശയങ്ങൾക്കിടയിൽ ഒരു പാലം നിർമ്മിച്ചേക്കാം. കടുപ്പമേറിയ പാറ്റേൺ മാച്ചിംഗിന് നൽകാൻ കഴിയാത്ത ഇത്തരമൊരു വഴക്കമാണ് (flexibility) ഇതിന്റെ പ്രത്യേകത.

സങ്കീർണ്ണമായ പ്രശ്നപരിഹാരം (Complex problem solving). ഒരു മോഡൽ ഓർമ്മിച്ചുവെച്ച ടെംപ്ലേറ്റുകളെ ആശ്രയിക്കുമ്പോൾ, പ്രോംപ്റ്റ് അതിന്റെ ട്രെയിനിംഗ് ഡാറ്റയ്ക്ക് പുറത്താണെങ്കിൽ അത് പരാജയപ്പെടാൻ സാധ്യതയുണ്ട്. എന്നാൽ ഒരു ആന്തരിക മോഡലിംഗ് രീതി യഥാർത്ഥത്തിൽ അപരിചിതമായ സാഹചര്യങ്ങളെ മികച്ച രീതിയിൽ കൈകാര്യം ചെയ്യും, കാരണം സിസ്റ്റം ഒരു സാമ്യമുള്ള പാറ്റേണിനായി തിരയുകയല്ല ചെയ്യുന്നത്. അത് പുതിയ സാഹചര്യത്തിന്റെ ഒരു മാപ്പ് നിർമ്മിക്കുകയും അതിലൂടെ ഒരു പാത കണ്ടെത്തുകയും ചെയ്യുന്നു.

വിശദീകരിക്കാവുന്ന യുക്തി (Explainable logic). ദൈനംദിന ഉപയോക്താക്കൾക്ക് ലഭിക്കുന്ന ഏറ്റവും വലിയ നേട്ടം, അതിന്റെ ഉത്തരത്തിന് പിന്നിലെ ഘട്ടങ്ങൾ Claude വിശദീകരിക്കാൻ കഴിയുന്നു എന്നതാണ്. ഒരു നിഗമനം മാത്രം നൽകി അത് ശരിയാണോ എന്ന് ഊഹിക്കാൻ നിങ്ങളെ നിർബന്ധിക്കുന്നതിന് പകരം, ആ യുക്തിയുടെ ഘട്ടങ്ങളിലൂടെ (reasoning chain) മോഡലിന് നിങ്ങളെ നയിക്കാൻ കഴിയും. ഇത് ആശയവിനിമയത്തെ ഒരു അന്ധമായ ഊഹത്തിൽ നിന്ന് നിങ്ങൾക്ക് പരിശോധിക്കാവുന്ന ഒരു സംഭാഷണമാക്കി മാറ്റുന്നു.

എന്തുകൊണ്ടാണ് വിശദീകരിക്കാനുള്ള കഴിവ് (Explainability) യഥാർത്ഥത്തിൽ പ്രസക്തമാകുന്നത്

മിക്ക AI സിസ്റ്റങ്ങളും 'ബ്ലാക്ക് ബോക്സുകൾ' പോലെയാണ് പ്രവർത്തിക്കുന്നത്. നിങ്ങൾ ഇൻപുട്ട് നൽകുന്നു, ഔട്ട്പുട്ട് ലഭിക്കുന്നു, എന്നാൽ ഇടയിലുള്ള യുക്തി നിങ്ങൾക്ക് ലഭ്യമാകില്ല. Claude അതിന്റെ യുക്തി വിശദീകരിക്കുമ്പോൾ, അത് ആ ബോക്സ് തുറന്ന് യഥാർത്ഥത്തിൽ ഉപയോഗപ്രദമായ രീതിയിൽ വിവരങ്ങൾ നൽകുന്നു.

ഡെവലപ്പർമാരെ സംബന്ധിച്ചിടത്തോളം, ഇതിനർത്ഥം 'ഡീബഗ്ഗബിലിറ്റി' (debuggability) ആണ്. ഒരു മോഡൽ ലോൺ അപേക്ഷ നിരസിക്കുകയോ, സുരക്ഷിതമല്ലാത്ത വൈദ്യശാസ്ത്ര നിർദ്ദേശങ്ങൾ നൽകുകയോ, പക്ഷപാതപരമായ ഉള്ളടക്കം നിർമ്മിക്കുകയോ ചെയ്താൽ, എവിടെയാണ് തെറ്റുപറ്റിയതെന്ന് കണ്ടെത്താൻ എഞ്ചിനീയർമാർക്ക് അതിന്റെ യുക്തി പരിശോധിക്കാനാകും. തെറ്റ് വന്നത് മോശം ട്രെയിനിംഗ് ഡാറ്റ കൊണ്ടാണോ, തെറ്റായ പ്രോംപ്റ്റ് കൊണ്ടാണോ, അതോ ഒരു സാंख्यിക പിശക് കൊണ്ടാണോ എന്ന് അവർക്ക് ഇനി ഊഹിക്കേണ്ടി വരില്ല. അവർക്ക് തെറ്റുകൾ കണ്ടെത്തുന്നതിനുള്ള സൂചനകൾ പിന്തുടരാം.

സാധാരണ ഉപയോക്താക്കളെ സംബന്ധിച്ചിടത്തോളം, വിശദീകരിക്കാനുള്ള കഴിവ് യാഥാർത്ഥ്യങ്ങളുമായി ഇടപഴകുമ്പോഴും നിലനിൽക്കുന്ന വിശ്വാസം വളർത്തുന്നു. യുക്തിസഹമായ ഒരു ഘടന കാണുന്ന ഉപയോക്താവിന്, ആ അനുമാനങ്ങൾ അവരുടെ പ്രത്യേക സാഹചര്യത്തിന് അനുയോജ്യമാണോ എന്ന് പരിശോധിക്കാൻ കഴിയും. തെറ്റായ ഉപദേശങ്ങൾ അനുസരിച്ച് പ്രവർത്തിച്ച് പിന്നീട് പിശക് തിരിച്ചറിയുന്നതിന് പകരം, തെറ്റായ ഒരു അടിസ്ഥാനം നേരത്തെ തന്നെ കണ്ടെത്താൻ അവർക്ക് സാധിക്കും.

നിയന്ത്രണ ഏജൻസികൾക്കും നയരൂപകർത്താക്കൾക്കും, സുതാര്യമായ യുക്തിചിന്ത (reasoning) AI ഭരണനിർവ്വഹണത്തിൽ അപൂർവ്വമായ ഒന്ന് വാഗ്ദാനം ചെയ്യുന്നു: ഒരു ഓഡിറ്റ് ട്രയൽ (audit trail). സുരക്ഷാ നിയമങ്ങൾ തയ്യാറാക്കുന്ന നിയമനിർമ്മാതാക്കൾക്ക്, സിസ്റ്റങ്ങൾ തീരുമാനങ്ങൾ എടുക്കുന്നത് വ്യക്തമായ കാരണങ്ങളാലാണെന്ന് അറിയേണ്ടതുണ്ട്; അല്ലാതെ ട്രില്യൺ കണക്കിന് പാരാമീറ്ററുകൾക്കുള്ളിൽ ഒളിഞ്ഞിരിക്കുന്ന അജ്ഞാതമായ ബന്ധങ്ങളാലല്ല (inscrutable correlations). ഒരു AI അതിന്റെ പ്രവർത്തനരീതി കാണിച്ചുതരാൻ കഴിയുമെങ്കിൽ, ധാർമ്മികവും നിയമപരവുമായ മാനദണ്ഡങ്ങൾക്കനുസരിച്ച് വിലയിരുത്താൻ സർക്കാരുകൾക്ക് കൃത്യമായ ഒരു മാർഗ്ഗം ലഭിക്കുന്നു.

ബോധമനസ്സിനെക്കുറിച്ചുള്ള ചോദ്യം

ഈ ചർച്ചയുടെ കേന്ദ്രത്തിൽ ഒരു പ്രധാന മുന്നറിയിപ്പുണ്ട്. Claude ബോധമനസ്സുള്ളതാണെന്ന് Anthropic അവകാശപ്പെടുന്നില്ല. ഉന്നതതല യുക്തിചിന്തയും (advanced reasoning) ബോധവും (sentience) തമ്മിൽ വ്യക്തമായ അതിർവരമ്പുകൾ കമ്പനി നിലനിർത്തുന്നുണ്ട്. എങ്കിലും, മനുഷ്യന്റെ വൈജ്ഞാനിക പ്രക്രിയകളുമായുള്ള (cognitive processing) സാമ്യം സ്വാഭാവികമായും ചർച്ചകൾക്ക് വഴിതെളിക്കുന്നു.

ഒരു യന്ത്രം ആന്തരിക മാതൃകകൾ (internal models) നിർമ്മിക്കുകയും, അടുത്ത നീക്കങ്ങൾ ആസൂത്രണം ചെയ്യുകയും, അതിന്റെ യുക്തി വ്യക്തമാക്കുകയും ചെയ്യുമ്പോൾ, അത് ഒരു കാൽക്കുലേറ്ററിനേക്കാൾ ഉപരിയായി ഒരു ചിന്തിക്കുന്ന മനസ്സിനെപ്പോലെ തോന്നിക്കാൻ തുടങ്ങുന്നു. ഇത് യഥാർത്ഥമായ ദാർശനിക സംഘർഷങ്ങൾ സൃഷ്ടിക്കുന്നു. യന്ത്രങ്ങളുടെ ബോധം അളക്കാൻ നിലവിൽ നമുക്ക് വിശ്വസനീയമായ പരിശോധനകളില്ല, വരും വർഷങ്ങളിലും ഉണ്ടായേക്കില്ല. എന്നാൽ ഒരു സിസ്റ്റത്തിന്റെ പെരുമാറ്റം കൊണ്ട് മാത്രം അതിന്റെ ആന്തരിക അനുഭവം (inner experience) അളക്കാൻ കഴിയില്ലെന്ന് നമുക്കറിയാം. ചെസ്സ് എഞ്ചിന് ചെസ്സ് എന്നാൽ എന്താണെന്ന് മനസ്സിലാക്കാതെ തന്നെ ഒരു ഗ്രാൻഡ് മാസ്റ്ററെ തോൽപ്പിക്കാൻ കഴിയുന്നതുപോലെ, ബോധമില്ലാതെ തന്നെ ഒരു സിസ്റ്റത്തിന് ചിന്തിച്ചതുപോലെ പ്രവർത്തിക്കാൻ കഴിയും.

യന്ത്രങ്ങളിൽ മനുഷ്യസഹജമായ ഗുണങ്ങൾ ആരോപിക്കാനുള്ള പ്രവണത ഒഴിവാക്കി, യുക്തിചിന്താ ശേഷി മെച്ചപ്പെടുത്തുക എന്നതാണ് ഉത്തരവാദിത്തപരമായ വഴി. തലച്ചോറിനെ അനുകരിക്കുന്ന ഈ പെരുമാറ്റം ശാസ്ത്രീയമായി താൽപ്പര്യജനകമാണ്. ഇത് ബോധത്തെക്കുറിച്ച് എന്തെങ്കിലും സൂചിപ്പിക്കുന്നുണ്ടോ എന്നത് ഇപ്പോഴും ഒരു തുറന്ന ചോദ്യമായി തുടരുന്നു, അത് നിസ്സാരമായി എടുക്കേണ്ട ഒന്നല്ല.

AI പരിശോധനാരീതികളെക്കുറിച്ച് പുനർചിന്തനം ചെയ്യുന്നു

Claude പ്രവചിക്കുന്നതിന് (predicting) പകരം യുക്തിചിന്തിക്കുകയാണെങ്കിൽ, നമ്മുടെ മൂല്യനിർണ്ണയ രീതികൾ കാലഹരണപ്പെട്ടതായി മാറുകയാണ്. നിലവിലുള്ള AI ബെഞ്ച്മാർക്കുകൾ ശരിയായ ഉത്തരങ്ങൾക്കാണ് മുൻഗണന നൽകുന്നത്. എന്നാൽ ആ ഉത്തരങ്ങളിലേക്ക് മോഡൽ എങ്ങനെ എത്തിച്ചേർന്നു എന്ന് അവ അപൂർവ്വമായി മാത്രമേ ചോദിക്കുന്നുള്ളൂ. ഒരു മാത്തമാറ്റിക്സ് അല്ലെങ്കിൽ കോഡിംഗ് ടെസ്റ്റിൽ, മുൻകൂട്ടി പഠിച്ച ഉത്തരങ്ങൾ ഉപയോഗിച്ച് ഒരു സിസ്റ്റത്തിന് ഉയർന്ന സ്കോർ നേടാൻ കഴിഞ്ഞേക്കാം, എന്നാൽ അത് പുതിയ ചിന്താശേഷിയെക്കുറിച്ച് (novel thought) നമുക്ക് വളരെ കുറച്ചു മാത്രമേ പറഞ്ഞുതരുന്നുള്ളൂ.

ആന്തരിക യുക്തി പരിശോധിക്കുന്ന ഫ്രെയിംവർക്കുകൾ നമുക്ക് ആവശ്യമാണ്. അതായത്, പരിശീലന ഡാറ്റയിൽ (training distribution) നിന്ന് തികച്ചും വ്യത്യസ്തമായ പ്രശ്നങ്ങൾ അവതരിപ്പിക്കുകയും, തുടർന്ന് അതിന്റെ യുക്തിയുടെ ഘട്ടങ്ങൾ (reasoning chain) പരിശോധിക്കുകയും ചെയ്യുക എന്നതാണ്. തിരുത്തലുകൾ വരുത്തുമ്പോൾ മോഡലിന് അതിന്റെ തെറ്റായ ഘട്ടങ്ങൾ തിരിച്ചറിയാൻ കഴിയുന്നുണ്ടോ എന്ന് പരിശോധിക്കണം. ഘടകങ്ങൾ പുനഃക്രമീകരിക്കുകയോ തിരിച്ചിടുകയോ ചെയ്യുമ്പോൾ ആശയങ്ങൾ (compositional concepts) സ്ഥിരതയുള്ളതാണോ എന്ന് ഉറപ്പുവരുത്തണം.

ഒരു ഓട്ടോമേറ്റഡ് ലീഡർബോർഡ് പ്രവർത്തിപ്പിക്കുന്നതിനേക്കാൾ പ്രയാസമാണ് ഈ രീതി. വെറും ഉത്തരത്തിന്റെ കൃത്യതയല്ല, മറിച്ച് യുക്തിയുടെ ഗുണനിലവാരം വിലയിരുത്താൻ വിഷയത്തിൽ ആഴത്തിലുള്ള അറിവുള്ള മനുഷ്യ evaluators-നെ ഇത് ആവശ്യപ്പെടുന്നു. എന്നാൽ j-space reasoning യഥാർത്ഥമാണെങ്കിൽ, AI കമ്മ്യൂണിറ്റിക്ക് മറ്റ് മാർഗ്ഗങ്ങളില്ല. നമ്മൾ വെറും അവസാന ഉത്തരമല്ല, മറിച്ച് അതിന്റെ പ്രവർത്തനരീതി കൂടി വിലയിരുത്താൻ തുടങ്ങണം.

ചുരുക്കത്തിൽ: Claude-ന്റെ ആന്തരിക മാതൃകകളിലേക്കുള്ള ചുവടുവെപ്പ് അതിനെ ഒരു മനുഷ്യനാക്കുന്നില്ല. എന്നാൽ ഇത് സിസ്റ്റത്തെ കൂടുതൽ ഉപയോഗപ്രദവും, പരിശോധിക്കാവുന്നതും, സത്യസന്ധമായി വിലയിരുത്താൻ പ്രയാസമുള്ളതുമാക്കുന്നു. "ശരി" എന്നത് മാത്രം മതിയാകാത്ത ഒരു ഘട്ടത്തിലൂടെയാണ് നമ്മൾ കടന്നുപോകുന്നത്. തങ്ങളുടെ പ്രവർത്തനരീതി കാണിക്കാനും, പരിമിതികൾ സമ്മതിക്കാനും, അപരിചിതമായ പ്രശ്നങ്ങളിൽ യുക്തിപരമായി ചിന്തിക്കാനും കഴിയുന്ന സിസ്റ്റങ്ങളായിരിക്കും AI വികസനത്തിന്റെ അടുത്ത ഘട്ടത്തിൽ മുന്നിലെത്തുക. ഇത് ദാർശനികമായി ചിന്തയാണോ എന്നത് അടുത്ത പതിറ്റാണ്ടിലെ ചർച്ചയാണ്. നിലവിൽ, ഈ മോഡലുകൾ യഥാർത്ഥത്തിൽ ചെയ്യുന്ന കാര്യങ്ങളുടെ സങ്കീർണ്ണതയ്ക്ക് അനുസൃതമായ ടൂളുകളും മാനദണ്ഡങ്ങളും നിർമ്മിക്കുക എന്നതാണ് പ്രായോഗികമായ ദൗത്യം.

Source: Anthropic's Claude mimics human brain processing

Optional learning community: GyaanSetu AI on Telegram