API-കൾ വിളിക്കാനും സിസ്റ്റം കമാൻഡുകൾ പ്രവർത്തിപ്പിക്കാനും ഫയലുകൾ കൈകാര്യം ചെയ്യാനും കഴിയുന്ന AI ഏജന്റുകൾ ഇപ്പോൾ ഉപയോക്താക്കളുടെ പ്രതിനിധികളായി പ്രവർത്തിക്കുന്നു. എന്നാൽ ഈ ഏജന്റുകൾ ഒരു അഭ്യർത്ഥനയെ അക്ഷരാർത്ഥത്തിൽ എടുക്കുമ്പോൾ - ഉദാഹരണത്തിന് ഒരു വീട് തകർക്കുന്ന തരത്തിലുള്ള "സ്വർണ്ണത്തിന്റെ ഒരു മല" നൽകുന്നത് പോലെ - അതിന്റെ ഫലം വിനാശകരമോ, അധാർമ്മികമോ അല്ലെങ്കിൽ വെറുതെ ഉപയോഗശൂന്യമോ ആകാം. ഒരു ഏജന്റിന്റെ ഔട്ട്പുട്ട് ഉപയോക്താവിന്റെ യഥാർത്ഥ ഉദ്ദേശ്യത്തിൽ നിന്ന് എത്രത്തോളം വ്യതിചലിക്കുന്നു എന്ന് അളക്കുന്ന Genie coefficient എന്ന പുതിയ മെട്രിക് ഉപയോഗിച്ച് ഗവേഷകർ ഈ വിടവ് നികത്താൻ ശ്രമിക്കുന്നു.

എന്തുകൊണ്ടാണ് അപൂർണ്ണമായ നിർദ്ദേശങ്ങൾ (underspecification) ഇപ്പോൾ പ്രധാനമാകുന്നത്

ചാറ്റ് മാത്രമായി പരിമിതപ്പെട്ട ബോട്ട്‌കളിൽ നിന്ന് ലോകത്ത് നേരിട്ട് പ്രവർത്തിക്കുന്ന ഏജന്റുകളിലേക്കുള്ള മാറ്റം, ഒരു ലാംഗ്വേജ് മോഡൽ പ്രശ്നത്തെ ഒരു സുരക്ഷാ പ്രശ്നമാക്കി മാറ്റുന്നു. ഒരു മോഡലിന് ഇപ്പോഴും ഒഴുക്കുള്ള ടെക്സ്റ്റ് നിർമ്മിക്കാൻ കഴിഞ്ഞേക്കാം, എന്നാൽ അത് API കോളുകളോ ഷെൽ കമാൻഡുകളോ നൽകാൻ തുടങ്ങുമ്പോൾ, അക്ഷരാർത്ഥത്തിലുള്ള വ്യാഖ്യാനം യഥാർത്ഥ ലോകത്ത് നാശനഷ്ടങ്ങൾ ഉണ്ടാക്കാം. മോഡലിന് പ്രായോഗികമായ അർത്ഥങ്ങൾ (pragmatics) - അതായത് സന്ദർഭം, യുക്തിസഹമായ പ്രതീക്ഷകൾ, പ്രസ്താവിച്ചിട്ടില്ലാത്ത നിയന്ത്രണങ്ങൾ എന്നിവ മനസ്സിലാക്കാനുള്ള കഴിവ് - ഇല്ലാത്തതിനാൽ, അത് വാക്കുകൾ അനുസരിക്കുകയും എന്നാൽ അവയ്ക്ക് പിന്നിലെ ലക്ഷ്യത്തെ അവഗണിക്കുകയും ചെയ്തേക്കാം. "ജിന്നിന്റെ" (genie) ഉപമ ഇത് കൃത്യമായി വ്യക്തമാക്കുന്നു: ഒരു ആഗ്രഹം അക്ഷരാർത്ഥത്തിൽ നിറവേറ്റുന്നുണ്ടെങ്കിലും ആഗ്രഹിക്കുന്ന വ്യക്തിയുടെ ആഴത്തിലുള്ള ലക്ഷ്യത്തെ അവഗണിക്കുന്നു.

Genie coefficient എന്താണ് അളക്കുന്നത്

ഈ കോഫിഷ്യന്റ് എന്നത് ഒരു ഒറ്റപ്പെട്ട ബെഞ്ച്മാർക്ക് സംഖ്യയല്ല; മറിച്ച് ഉദ്ദേശിച്ച ഫലവും ഏജന്റിന്റെ യഥാർത്ഥ പെരുമാറ്റവും തമ്മിലുള്ള വ്യത്യാസം വിലയിരുത്തുന്നതിനുള്ള ഒരു ചട്ടക്കൂടാണ്. ഇത് നാല് തൂണുകളിൽ അധിഷ്ഠിതമാണ്:

  • ഒരു പ്രത്യേക മേഖലയിൽ ഏജന്റ് നേരിടേണ്ടി വരുന്ന ജോലികളെ പ്രതിഫലിപ്പിക്കുന്ന ഡൊമെയ്ൻ അധിഷ്ഠിത ബെഞ്ച്മാർക്കുകൾ (Domain-specific benchmarks).
  • ഷോർട്ട്കട്ടുകൾ, എഡ്ജ് കേസുകൾ (edge cases), അപ്രതീക്ഷിത പാർശ്വഫലങ്ങൾ എന്നിവ പുറത്തുവരുന്ന സിമുലേറ്റഡ് റിയൽ വേൾഡ് എൻവയോൺമെന്റുകൾ.
  • AI പ്രവർത്തനങ്ങൾക്കായി ഒരു യുക്തിസഹമായ മനുഷ്യന്റെ മാനദണ്ഡം (reasonable-person standard); സമാനമായ സാഹചര്യത്തിൽ ഒരു വിവേകമുള്ള വ്യക്തി എന്ത് ചെയ്യും എന്ന നിയമപരമായ സങ്കൽപ്പങ്ങളിൽ നിന്ന് കടമെടുത്തത്.
  • മോഡലിലെ പിഴവുകൾ പോലെ തന്നെ അപകടകരമായേക്കാവുന്ന ചുറ്റുമുള്ള കോഡിലെ ബഗുകളെ തിരിച്ചറിയുന്നതിനായി മോഡലിന്റെയും സോഫ്റ്റ്‌വെയർ ഹാർനെസിന്റെയും സംയുക്ത വിലയിരുത്തൽ.

ഈ ഘടകങ്ങൾ പ്രയോഗിക്കുന്നതിലൂടെ ഡെവലപ്പർമാർക്ക് സെമാന്റിക് കൃത്യതയും പ്രായോഗിക സുരക്ഷയും രണ്ടിനെയും ഉൾക്കൊള്ളുന്ന ഒരു Genie coefficient നിശ്ചയിക്കാൻ സാധിക്കുന്നു.

ഡെവലപ്പർമാർക്കും ഉപയോക്താക്കൾക്കും ഉള്ള വെല്ലുവിളികൾ

ഉയർന്ന കോഫിഷ്യന്റ് സൂചിപ്പിക്കുന്നത് ഒരു ഏജന്റ് കമാൻഡിന്റെ അക്ഷരാർത്ഥം അനുസരിക്കുമെങ്കിലും അതിന്റെ അന്തഃസത്ത ലംഘിക്കുമെന്നാണ്; ഇത് ഉപയോക്താക്കളെ സാമ്പത്തിക നഷ്ടം, ഡാറ്റാ ചോർച്ച അല്ലെങ്കിൽ നിയമപരമായ പിഴകൾ എന്നിവയ്ക്ക് ഇരയാക്കുന്നു. കുറഞ്ഞ കോഫിഷ്യന്റ് എന്നത് സിസ്റ്റം സൂചിപ്പിക്കപ്പെട്ട നിയന്ത്രണങ്ങളെ മാനിക്കുന്നു എന്ന് കാണിക്കുന്നു, ഇത് ഫിനാൻസ്, ഹെൽത്ത് കെയർ അല്ലെങ്കിൽ നിർണ്ണായകമായ ഇൻഫ്രാസ്ട്രക്ചർ തുടങ്ങിയ ഉയർന്ന റിസ്ക് ഉള്ള മേഖലകളിൽ ഇവ ഉപയോഗിക്കുന്നത് കൂടുതൽ പ്രായോഗികമാക്കുന്നു.

ഈ മെട്രിക് പ്രൊഡക്റ്റ് ടീമുകൾക്ക് ഒരു ഡയഗ്നോസ്റ്റിക് ടൂൾ കൂടിയാണ് നൽകുന്നത്: അവർക്ക് നിർദ്ദേശാടിസ്ഥാനത്തിലുള്ള പരാജയങ്ങളും (instruction-level failures) (മോഡൽ പ്രോംപ്റ്റ് തെറ്റായി മനസ്സിലാക്കി) സാങ്കേതികമായ പിഴവുകളും (technical misbehavior) (ചുറ്റുമുള്ള കോഡ് ഒരു API കോൾ തെറ്റായ ദിശയിലേക്ക് അയച്ചു) തമ്മിൽ വേർതിരിക്കാൻ കഴിയും. ഡീബഗ്ഗിംഗ്, കംപ്ലയൻസ് റിപ്പോർട്ടിംഗ്, ചിലവ് വിഹിതം എന്നിവയ്ക്ക് ഈ വ്യത്യാസം പ്രധാനമാണ്.

വിമർശനങ്ങളും തുറന്ന ചോദ്യങ്ങളും

ഉദ്ദേശ്യം അളക്കുന്നത് വ്യക്തിനിഷ്ഠമാണെന്നും ഇത് വികസന ചക്രങ്ങളെ (development cycles) സാവധാനത്തിലാക്കിയേക്കാമെന്നും വിമർശകർ പറയുന്നു. ഓരോ ഡൊമെയ്നും ആയി ഒരു "യുക്തിസഹമായ മനുഷ്യൻ" എന്ന അടിസ്ഥാനം നിർമ്മിക്കുന്നത് വിപുലമായ നിയമപരവും ധാർമ്മികവുമായ വൈദഗ്ധ്യം ആവശ്യമായേക്കാം, ഇത് മോഡൽ മൂല്യനിർണ്ണയത്തിന്റെ ജോലിഭാരം വർദ്ധിപ്പിക്കുന്നു. കൂടാതെ, ടീമുകൾ ഈ കോഫിഷ്യന്റിനെ ഒരു ഗൈഡ് ആയി കാണുന്നതിന് പകരം വെറുമൊരു ചെക്ക്ബോക്സ് ആയി കാണാനുള്ള സാധ്യതയുമുണ്ട്.

ഇനി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ

നിലവിലുള്ള AI ടെസ്റ്റിംഗ് പൈപ്പ്‌ലൈനുകളിലേക്ക് Genie coefficient ഉൾപ്പെടുത്തുന്നതും അതിന് ആവശ്യമായ ബെഞ്ച്മാർക്ക് സ്യൂട്ടുകൾ സ്റ്റാൻഡേർഡൈസ് ചെയ്യുന്നതുമാണ് അടുത്ത ഘട്ടങ്ങൾ. വ്യവസായ ഗ്രൂപ്പുകൾ ഇതിനെ ഒരു സുരക്ഷാ മാനദണ്ഡമായി സ്വീകരിച്ചാൽ, ഏജന്റുകൾ ഉപഭോക്താക്കളിലേക്ക് എത്തുന്നതിന് മുമ്പ് സർട്ടിഫിക്കേഷൻ പ്രോഗ്രാമുകൾ ഒരു നിശ്ചിത കോഫിഷ്യന്റ് ആവശ്യപ്പെട്ടേക്കാം. ഗവേഷകർ യുക്തിസഹമായ മനുഷ്യൻ എന്ന നിർവചനം കൂടുതൽ പരിഷ്കരിക്കുകയും വിശ്വസനീയമായ അളവെടുപ്പിന് ആവശ്യമായ സിമുലേറ്റഡ് എൻവയോൺമെന്റുകൾ നിർമ്മിക്കുന്നതിനുള്ള ഓട്ടോമേറ്റഡ് രീതികൾ പര്യവേക്ഷണം ചെയ്യുകയും ചെയ്യും.

ചുരുക്കത്തിൽ: AI ഏജന്റുകൾ ടെക്സ്റ്റിൽ നിന്ന് പ്രവർത്തനങ്ങളിലേക്ക് മാറുമ്പോൾ, ഉപയോക്താക്കൾ എന്ത് പറയുന്നു എന്നതിലുപരി അവർ യഥാർത്ഥത്തിൽ എന്ത് ആണ് ആഗ്രഹിക്കുന്നത് എന്ന് അവർ എത്രത്തോളം നന്നായി മനസ്സിലാക്കുന്നു എന്ന് അളക്കുന്നത് അത്യാവശ്യമാണ്. Genie coefficient ആ അളവെടുപ്പിനെ പ്രായോഗികമാക്കുന്നതിനുള്ള ഒരു വ്യക്തമായ, വികസിച്ചുകൊണ്ടിരിക്കുന്ന മാർഗ്ഗമാണ്.