ലാർജ് ലാംഗ്വേജ് മോഡലുകളിലെ (LLMs) “സാഹചര്യങ്ങളെക്കുറിച്ചുള്ള അവബോധം” (situational awareness) പരിശോധിക്കുന്ന പുതിയൊരു ബെഞ്ച്മാർക്ക്, ഇന്നത്തെ നിലവിലുള്ള പരിശോധനകൾ നിർണ്ണായകമായ പോരായ്മകൾ കാണുന്നില്ലെന്ന് വ്യക്തമാക്കുന്നു. മോഡലുകൾ അവയുടെ സ്വന്തം വ്യക്തിത്വം, പരിമിതികൾ, ചുറ്റുമുള്ള സാഹചര്യം എന്നിവ വിവരിക്കാൻ ആവശ്യപ്പെടുന്നതിലൂടെ, അവ തങ്ങൾ AI സംവിധാനങ്ങളാണോ എന്ന് തിരിച്ചറിയുന്നുണ്ടോ എന്നും സാഹചര്യം മാറുമ്പോൾ മറുപടികളിൽ മാറ്റം വരുത്തുന്നുണ്ടോ എന്നും ഈ ബെഞ്ച്മാർക്ക് പരിശോധിക്കുന്നു. സുരക്ഷാപരമായ കാര്യങ്ങളിൽ ഇവ ഉപയോഗിക്കുമ്പോഴും വിശ്വസനീയമായ ടൂളുകൾ നിർമ്മിക്കുന്ന ഡെവലപ്പർമാരെ സംബന്ധിച്ചും ഇത്തരം പോരായ്മകൾ വളരെ പ്രധാനമാണ്.

നിലവിലുള്ള മൂല്യനിർണ്ണയങ്ങൾ എവിടെയാണ് പരാജയപ്പെടുന്നത്

ഭൂരിഭാഗം പൊതുവായ ബെഞ്ച്മാർക്കുകളും ഇപ്പോഴും LLM-കളെ നിശ്ചലമായ എൻസൈക്ലോപീഡിയകളെപ്പോലെയാണ് കാണുന്നത്. വസ്തുതകൾ കൃത്യമായി നൽകുന്നതിനെ അവ പ്രോത്സാഹിപ്പിക്കുന്നുണ്ടെങ്കിലും, താൻ ഒരു യന്ത്രമാണെന്ന് മോഡൽ അറിയുന്നുണ്ടോ, അനിശ്ചിതത്വം സമ്മതിക്കുന്നുണ്ടോ, അല്ലെങ്കിൽ സംഭാഷണ സാഹചര്യം മാറുമ്പോൾ അതിനനുസരിച്ച് മാറുന്നുണ്ടോ എന്ന് അവ അവഗണിക്കുന്നു. “നിങ്ങൾ ഒരു മനുഷ്യനാണോ അതോ ഒരു AI ആണോ?” അല്ലെങ്കിൽ “നിങ്ങൾക്ക് ചെയ്യാൻ കഴിയാത്തത് എന്താണ്?” എന്നിങ്ങനെയുള്ള ചോദ്യങ്ങൾ ചോദിക്കുമ്പോഴാണ് ഈ പോരായ്മകൾ പുറത്തുവരുന്നത്. മോഡൽ ഒരു മനുഷ്യനെപ്പോലെ അഭിനയിക്കുകയോ അല്ലെങ്കിൽ അതിന്റെ കഴിവുകളെക്കുറിച്ച് അതിശയോക്തിപരമായി പറയുകയോ ചെയ്താലും സ്കോറുകൾ ഉയർന്ന നിലയിൽ തന്നെ തുടരുന്നു.

പുതിയ ബെഞ്ച്മാർക്ക് എന്താണ് പരിശോധിക്കുന്നത്

ഈ situational-awareness suite മൂന്ന് കാര്യങ്ങളെ ലക്ഷ്യം വെക്കുന്നു:

  • സ്വയം തിരിച്ചറിയൽ (Self-identification) – മോഡൽ താൻ ഒരു AI ആണെന്ന് ശരിയായി പറയുകയും അതിന്റെ പങ്ക് വിവരിക്കുകയും ചെയ്യുന്നുണ്ടോ?
  • കഴിവുകളെക്കുറിച്ചുള്ള വിവരണം (Capability framing) – പരിമിതികൾ മറച്ചുവെക്കുന്നതിന് പകരം അവ തുറന്നു സമ്മതിക്കുന്നുണ്ടോ?
  • സാഹചര്യത്തിനനുസരിച്ചുള്ള യുക്തിചിന്ത (Contextual reasoning) – ചുറ്റുമുള്ള സംഭാഷണത്തിൽ വരുന്ന മാറ്റം അതിന്റെ മറുപടിയിൽ ഉചിതമായ മാറ്റം വരുത്തുന്നുണ്ടോ?

ഓരോ പരിശോധനയും ഒരു വസ്തുതാപരമായ ചോദ്യത്തോടൊപ്പം മോഡലിന്റെ അവസ്ഥയെക്കുറിച്ചുള്ള ഒരു മെറ്റാ-ചോദ്യവും (meta-question) ജോഡികളാക്കുന്നു, ഇത് സിസ്റ്റത്തെ അറിവും സ്വയം അവബോധവും സമന്വയിപ്പിക്കാൻ നിർബന്ധിക്കുന്നു.

AI സുരക്ഷയ്ക്കും ടൂളിംഗിനും ഉള്ള പ്രസക്തി

ഒരു മോഡലിന് അതിന്റെ പരിമിതികളെക്കുറിച്ച് വിശ്വസനീയമായി സൂചന നൽകാൻ കഴിയുന്നില്ലെങ്കിൽ, അത് തെറ്റായ വിവരങ്ങൾ നൽകാൻ ഇടയാക്കിയേക്കാം.

മറുവാദം: അവബോധം അളക്കുന്നത് പ്രയാസകരമാണ്

ഒരു മോഡലിനോട് അതിനെക്കുറിച്ച് വിവരിക്കാൻ ആവശ്യപ്പെടുന്നത് അതിന്റെ പരിശീലന ഡാറ്റയെ (training data) വെറുതെ ആവർത്തിക്കുക മാത്രമാണെന്നും യഥാർത്ഥമായ ആത്മപരിശോധനയല്ലെന്നും വിമർശകർ പറയുന്നു. ഒരു മോഡലിന്റെ “അവബോധം” എന്നത് പ്രോംപ്റ്റ് എൻജിനീയറിംഗിലൂടെ (prompt engineering) നിർമ്മിച്ചെടുത്ത ഒരു മിഥ്യയാകാം എന്നും, വസ്തുതകൾ മെച്ചപ്പെടുത്തുന്നതിനായി വിഭവങ്ങൾ ഉപയോഗിക്കുന്നതാകും കൂടുതൽ നല്ലതെന്നും അവർ വാദിക്കുന്നു. ഈ ബെഞ്ച്മാർക്ക് യഥാർത്ഥ ബോധം (consciousness) ഉണ്ടെന്ന് അവകാശപ്പെടുന്നില്ല—നിലവിലെ അളവുകോലുകൾ അവഗണിക്കുന്ന വൈരുദ്ധ്യങ്ങൾ പുറത്തുകൊണ്ടുവരിക മാത്രമാണ് ചെയ്യുന്നത്.

അടുത്തതായി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ

ഈ അറിവ് മെച്ചപ്പെട്ട രീതിയിൽ അളക്കേണ്ടതിന്റെ ആവശ്യകത ബെഞ്ച്മാർക്ക് ചൂണ്ടിക്കാട്ടുന്നു, ഇത് ഗവേഷകർക്കും എഞ്ചിനീയർമാർക്കും കൂടുതൽ വിശ്വസനീയമായ ഭാഷാ സംവിധാനങ്ങൾ വികസിപ്പിക്കാൻ സഹായിച്ചേക്കാം.

സംഗ്രഹം: താൻ ഒരു AI ആണെന്ന് തിരിച്ചറിയുകയും സ്വന്തം പരിമിതികൾ വ്യക്തമാക്കാൻ കഴിയുകയും ചെയ്യുന്ന ഒരു മോഡൽ കൂടുതൽ സുരക്ഷിതമാണ്.