സ്വയംഭരണാധികാരമുള്ള AI ഏജന്റുകളെ വിന്യസിക്കാൻ കമ്പനികൾ മത്സരിക്കുകയാണ്, എന്നാൽ ആഭ്യന്തര പരിശോധനകളും യഥാർത്ഥ ലോകത്തിലെ പ്രകടനവും തമ്മിൽ അപകടകരമായ ഒരു വിടവ് രൂപപ്പെടുന്നുണ്ട്. കമ്പനികൾ ഏജന്റുകൾക്ക് കൂടുതൽ സ്വയംഭരണാധികാരം നൽകുന്നുണ്ടെങ്കിലും, ഉപഭോക്താക്കളുമായി ഇടപഴകുമ്പോൾ സംഭവിക്കാവുന്ന പിഴവുകൾ മുൻകൂട്ടി കാണാൻ ഗവേണൻസ് ഫ്രെയിംവർക്കുകൾക്ക് സാധിക്കുന്നില്ല.

യാഥാർത്ഥ്യവുമായുള്ള പൊരുത്തക്കേട് (The Reality-Alignment Problem)

എന്റർപ്രൈസ് AI-യിൽ ഞെട്ടിക്കുന്ന ഒരു "ഇവാലുവേഷൻ ഗ്യാപ്പ്" (evaluation gap) VentureBeat Pulse റിസർച്ച് കണ്ടെത്തി. അമ്പത് ശതമാനം കമ്പനികളും ആഭ്യന്തര പരിശോധനകളിൽ വിജയിച്ച ഒരു AI ഏജന്റോ LLM ഫീച്ചറോ പുറത്തിറക്കിയിരുന്നു, എന്നാൽ യഥാർത്ഥ ഉപഭോക്താക്കൾ അത് ഉപയോഗിക്കാൻ തുടങ്ങിയ നിമിഷം തന്നെ അവ പരാജയപ്പെട്ടു.

ഇതിലും മോശമായ കാര്യം, ആ കമ്പനികളിൽ 24% പേർക്കും ഇതേ പരാജയം ആവർത്തിച്ചുണ്ടായി എന്നതാണ്, ഇത് സങ്കീർണ്ണമായ സാഹചര്യങ്ങൾ (edge cases) മുൻകൂട്ടി കാണാനുള്ള കടുത്ത പോരായ്മ വെളിപ്പെടുത്തുന്നു. തെറ്റായ ഉത്തരങ്ങൾ നൽകുന്നതിനേക്കാൾ ഉപരിയായി, യുക്തിസഹമായ ചിന്താപ്രക്രിയയിലെ (reasoning chains) തകരാറുകൾ മൂലമാണ് പലപ്പോഴും പിഴവുകൾ സംഭവിക്കുന്നത്. നിലവിലെ ബെഞ്ച്മാർക്കുകൾ ഏജന്റുകളുടെ പ്രവർത്തനങ്ങളിലെ അപ്രതീക്ഷിതതയെ തിരിച്ചറിയുന്നില്ലെന്ന് ഇത് കാണിക്കുന്നു.

ഓട്ടോമേറ്റഡ് ഇവാലുവേഷനുകളിലെ വിശ്വാസ്യതയുടെ പ്രതിസന്ധി

സർവേയിൽ പങ്കെടുത്ത കമ്പനികളിൽ വെറും 5% മാത്രമാണ് ഇന്ന് ഓട്ടോമേറ്റഡ് ഇവാലുവേഷനുകളെ പൂർണ്ണമായും വിശ്വസിക്കുന്നത്. ഈ അവിശ്വാസത്തിന് രണ്ട് സാങ്കേതിക കാരണങ്ങളുണ്ട്:

  • യഥാർത്ഥ ലോകവുമായുള്ള മോശം പൊരുത്തം: ഉപഭോക്താക്കളുമായുള്ള ഇടപെടലുകളിൽ യഥാർത്ഥത്തിൽ സംഭവിക്കുന്നത് എന്താണെന്ന് തങ്ങളുടെ മൂല്യനിർണ്ണയങ്ങൾ പ്രതിഫലിപ്പിക്കുന്നില്ലെന്ന് 29% നേതാക്കൾ പറയുന്നു.
  • പക്ഷപാതവും അസ്ഥിരതയും: തങ്ങളുടെ ടെസ്റ്റിംഗ് ഫ്രെയിംവർക്കുകളിൽ നിന്ന് പക്ഷപാതപരമായതോ അസ്ഥിരമായതോ ആയ ഫലങ്ങൾ ലഭിക്കുന്നതായി 21% പേർ റിപ്പോർട്ട് ചെയ്യുന്നു.

ഇവാലുവേഷൻ സംവിധാനങ്ങൾ വിഭജിക്കപ്പെട്ട നിലയിലാണ്. പല കമ്പനികളും മോഡൽ ഡെവലപ്പർമാരുടെ തനതായ (native) ടൂളുകളെ മാത്രം ആശ്രയിക്കുന്നു; 17% കമ്പനികൾക്ക് പ്രത്യേകമായ ഇവാലുവേഷൻ ടൂളുകൾ പോലുമില്ല. ഏകദേശം നാലിലൊന്ന് കമ്പനികൾ ലൈവ് ട്രാഫിക്കിൽ തത്സമയ ഗുണനിലവാര പരിശോധനകൾ നടത്തുന്നുണ്ടെങ്കിലും, ഭൂരിഭാഗം കമ്പനികളും പ്രശ്നങ്ങൾ തിരിച്ചറിയുന്നത് ഉപഭോക്താക്കളിലേക്ക് എത്തിയതിന് ശേഷമാണ്.

സ്വയംഭരണാധികാരത്തിന്റെ വേഗതയും ഉറപ്പിന്റെ സാവധാനതയും

മൂന്നിൽ രണ്ട് ഭാഗം (66%) സ്ഥാപനങ്ങളും 'സീറോ-ഹ്യൂമൻ-ഇൻ-ദി-ലൂപ്പ്' (zero-human-in-the-loop) വിന്യാസത്തിലേക്ക് നീങ്ങുകയാണ്. മുപ്പത്തിനാല് ശതമാനം കമ്പനികൾ കുറഞ്ഞ റിസ്കുള്ള ഏജന്റുകൾക്കായി പൂർണ്ണമായും ഓട്ടോമേറ്റഡ് വിന്യാസം അനുവദിക്കുന്നുണ്ടെങ്കിലും, മറ്റൊരു 33% കമ്പനികൾ അടുത്ത പന്ത്രണ്ട് മാസത്തിനുള്ളിൽ ആ ഘട്ടത്തിലെത്താൻ ശ്രമിച്ചുകൊണ്ടിരിക്കുകയാണ്.

അവയെ നിരീക്ഷിക്കാനും തിരുത്താനും രൂപകൽപ്പന ചെയ്തിട്ടുള്ള സംവിധാനങ്ങളേക്കാൾ വേഗത്തിൽ ഏജന്റുകൾ തീരുമാനമെടുക്കാനുള്ള അധികാരം നേടുന്നു. സ്റ്റാറ്റിക് ബെഞ്ച്മാർക്കുകൾക്ക് പകരം, ലൈവ് ആയതും അപ്രതീക്ഷിതവുമായ ഉപഭോക്തൃ പെരുമാറ്റങ്ങളിലൂടെ ഏജന്റുകളെ പരിശോധിക്കുന്ന പ്രത്യേക ഒബ്സർവബിലിറ്റി (observability), ഇവാലുവേഷൻ പ്ലാറ്റ്‌ഫോമുകൾക്കായി വിപണി ഇപ്പോൾ ആവശ്യപ്പെടുന്നു.

പ്രധാന കാര്യങ്ങൾ

  • വിജയത്തിന്റെ വൈരുദ്ധ്യം: 50% കമ്പനികളും ആഭ്യന്തര പരിശോധനകളിൽ വിജയിച്ച ഏജന്റുകളെ പുറത്തിറക്കി, എന്നാൽ അവ പ്രൊഡക്ഷനിൽ പരാജയപ്പെട്ടു.
  • വിശ്വാസക്കുറവ്: ഓട്ടോമേറ്റഡ് ഇവാലുവേഷനുകളെ 5% മാത്രമാണ് പൂർണ്ണമായി വിശ്വസിക്കുന്നത്, കാരണം പരിശോധനകൾ യഥാർത്ഥ ലോകത്തെ ഫലങ്ങളുമായി പൊരുത്തപ്പെടുന്നില്ല.
  • സ്വയംഭരണാധികാരത്തിനായുള്ള മത്സരം: 66% കമ്പനികൾ നിലവിൽ 'സീറോ-ഹ്യൂമൻ-ഇൻ-ദി-ലൂപ്പ്' വിന്യാസങ്ങൾ ഉപയോഗിക്കുന്നു അല്ലെങ്കിൽ പ്ലാൻ ചെയ്യുന്നു.

കമ്പനികൾ പൂർണ്ണമായും സ്വയംഭരണാധികാരമുള്ള വിന്യാസങ്ങളിലേക്ക് കുതിക്കുമ്പോൾ തന്നെ, ആഭ്യന്തര പരിശോധനകൾ വിജയിക്കുന്ന എന്റർപ്രൈസ് AI ഏജന്റുകളിൽ പകുതിയോളം യഥാർത്ഥ ഉപഭോക്താക്കളെ കാണുന്നതോടെ പരാജയപ്പെടുന്നുവെന്ന് VentureBeat Pulse റിസർച്ച് കാണിക്കുന്നു. ഇത് വർദ്ധിച്ചുവരുന്ന ഒരു “ഇവാലുവേഷൻ ഗ്യാപ്പ്” ചൂണ്ടിക്കാണിക്കുന്നു.

LLM അടിസ്ഥാനമാക്കിയുള്ള ഏജന്റുകൾ വിന്യസിച്ചതോ അല്ലെങ്കിൽ വിന്യസിക്കാൻ തയ്യാറെടുക്കുന്നതോ ആയ കമ്പനികളെയാണ് ഈ പഠനം സർവേ ചെയ്തത്. പ്രതികരിച്ചവരിൽ 50% പേരും എല്ലാ ആഭ്യന്തര ബെഞ്ച്മാർക്കുകളും വിജയിച്ച ഒരു ഏജന്റിനെ പുറത്തിറക്കി, എന്നാൽ അത് പ്രൊഡക്ഷനിൽ പരാജയപ്പെടുന്നത് കണ്ടു. അധികമായി 24% പേർ ഇതേ പരാജയം ഒന്നിലധികം തവണ റിപ്പോർട്ട് ചെയ്തു, ഇത് ഇന്നത്തെ ടെസ്റ്റിംഗ് രീതികളിലെ ആവർത്തിച്ചുവരുന്ന ഒരു പോരായ്മയാണെന്ന് സ്ഥിരീകരിക്കുന്നു.

എന്തുകൊണ്ടാണ് ആഭ്യന്തര പരിശോധനകൾ പരാജയപ്പെടുന്നത്?

ഈ വിടവ് വെറും കവറേജിനെക്കുറിച്ച് മാത്രമല്ല. ലാബ് സിമുലേഷനുകളും യഥാർത്ഥ ലോകത്തെ സങ്കീർണ്ണമായ ഇടപെടലുകളും തമ്മിലുള്ള ആഴത്തിലുള്ള പൊരുത്തക്കേടാണ് പ്രതികരിച്ചവർ ചൂണ്ടിക്കാണിച്ചത്. തെറ്റായ ഉത്തരങ്ങൾ നൽകുന്നതിനേക്കാൾ ഉപരിയായി, ഏജന്റിന്റെ ആഭ്യന്തര യുക്തി പ്രതീക്ഷിച്ച ഫലങ്ങളിൽ നിന്ന് വ്യതിചലിക്കുന്ന സാഹചര്യങ്ങളിൽ—അതായത് ബ്രോക്കൺ റീസണിംഗ് ചെയിനുകളിൽ (broken reasoning chains)—നിന്നുമാണ് പലപ്പോഴും പിഴവുകൾ ഉണ്ടാകുന്നത്.

രണ്ട് സാങ്കേതിക പോരായ്മകളാണ് പ്രധാന പരാതികളിൽ കാണപ്പെടുന്നത്:

  • യഥാർത്ഥ ലോകവുമായുള്ള മോശം പൊരുത്തം – ഉപഭോക്താവ് ഏജന്റുമായി ഇടപഴകുമ്പോൾ യഥാർത്ഥത്തിൽ സംഭവിക്കുന്നത് എന്താണെന്ന് തങ്ങളുടെ മൂല്യനിർണ്ണയങ്ങൾ പ്രതിഫലിപ്പിക്കുന്നില്ലെന്ന് 29% നേതാക്കൾ പറഞ്ഞു.
  • പക്ഷപാതവും അസ്ഥിരതയും – തങ്ങളുടെ ടെസ്റ്റിംഗ് ഫ്രെയിംവർക്കുകൾ പക്ഷപാതപരമായതോ അസ്ഥിരമായതോ ആയ ഫലങ്ങൾ നൽകുന്നുവെന്ന് 21% പേർ ചൂണ്ടിക്കാട്ടി, ഇത് അവർ വിശ്വസിക്കുന്ന മെട്രിക്സുകളിലുള്ള ആത്മവിശ്വാസം കുറയ്ക്കുന്നു.

പ്രശ്നം കൂടുതൽ സങ്കീർണ്ണമാക്കുന്നത് ഇവാലുവേഷൻ സംവിധാനങ്ങളുടെ വിഭജനം മൂലമാണ്. പല എന്റർപ്രൈസുകളും മോഡൽ വെണ്ടർമാർ നൽകുന്ന തനതായ (native) ടൂളുകളെ മാത്രം ആശ്രയിക്കുന്നു, അതേസമയം 17% കമ്പനികൾക്ക് പ്രത്യേകമായ ഇവാലുവേഷൻ ടൂളുകൾ ഇല്ലെന്ന് സമ്മതിക്കുന്നു. ഏകദേശം നാലിലൊന്ന് കമ്പനികൾ മാത്രമാണ് ലൈവ് ട്രാഫിക്കിൽ തത്സമയ ഗുണനിലവാര പരിശോധനകൾ നടത്തുന്നത്, ഇത് ഭൂരിഭാഗം കമ്പനികളും പ്രശ്നങ്ങൾ തിരിച്ചറിയുന്നത് ഉപഭോക്താക്കളിലേക്ക് എത്തിയതിന് ശേഷമാണ്.

വിശ്വാസ്യത കുറവാണ്

സർവേയിൽ പങ്കെടുത്ത കമ്പനികളിൽ വെറും 5% മാത്രമാണ് ഇന്ന് ഓട്ടോമേറ്റഡ് ഇവാലുവേഷനുകളെ പൂർണ്ണമായും വിശ്വസിക്കുന്നത്. മുകളിൽ പറഞ്ഞ പൊരുത്തക്കേടുകളും പക്ഷപാതവും ആണ് ഈ വിശ്വാസക്കുറവിന് നേരിട്ടുള്ള കാരണം. ഒരു ടെസ്റ്റ് സ്യൂട്ടിന് പ്രൊഡക്ഷൻ പെരുമാറ്റം വിശ്വസനീയമായി പ്രവചിക്കാൻ കഴിയില്ലെങ്കിൽ, മനുഷ്യന്റെ മേൽനോട്ടമില്ലാതെ ഏജന്റുകളെ പ്രവർത്തിപ്പിക്കാൻ എക്സിക്യൂട്ടീവുകൾ മടിക്കുന്നു.

സ്വയംഭരണാധികാരം ഉറപ്പിനേക്കാൾ വേഗത്തിൽ മുന്നേറുന്നു

പരിശോധനകളിലുള്ള കുറഞ്ഞ വിശ്വാസമുണ്ടായിരുന്നിട്ടും, സ്വയംഭരണാധികാരത്തിനായുള്ള (autonomy) കുതിപ്പ് വിട്ടുവീഴ്ചയില്ലാത്തതാണ്. മറുപടി നൽകിയവരിൽ മൂന്നിൽ രണ്ട് ഭാഗം—66%—'zero-human-in-the-loop' വിന്യാസങ്ങളിലേക്ക് മാറിക്കൊണ്ടിരിക്കുകയാണ്. ആ വിഭാഗത്തിൽ, 34% പേർ കുറഞ്ഞ റിസ്ക് ഉള്ള ഏജന്റുകൾക്കായി പൂർണ്ണമായും ഓട്ടോമേറ്റഡ് റോളൗട്ടുകൾ അനുവദിക്കുന്നു, മറ്റ് 33% പേരും അടുത്ത പന്ത്രണ്ട് മാസത്തിനുള്ളിൽ ഇതേ ഘട്ടത്തിൽ എത്താനായി പൈപ്പ്‌ലൈനുകൾ രൂപകൽപ്പന ചെയ്തുകൊണ്ടിരിക്കുകയാണ്.

ഏജന്റുകളെ നിരീക്ഷിക്കാനും തിരുത്താനുമായി രൂപകൽപ്പന ചെയ്തിട്ടുള്ള സംവിധാനങ്ങളേക്കാൾ വേഗത്തിൽ അവ തീരുമാനമെടുക്കാനുള്ള അധികാരം കൈവരിക്കുന്നു. വിപണിയിലെ പ്രത്യാഘാതം വ്യക്തമാണ്: സ്റ്റാറ്റിക് ബെഞ്ച്മാർക്കുകൾക്ക് (static benchmarks) പകരം, പ്രവചനാതീതമായ യഥാർത്ഥ ഉപയോക്തൃ പെരുമാറ്റങ്ങളിലൂടെ ഏജന്റുകളെ വിലയിരുത്താൻ കഴിയുന്ന പ്രത്യേക ഒബ്സർവബിലിറ്റി (observability), ഇവാലുവേഷൻ (evaluation) പ്ലാറ്റ്‌ഫോമുകൾക്കായുള്ള വർദ്ധിച്ചുവരുന്ന ആവശ്യം.