AI ഏജന്റുകൾക്ക് അവരുടെ ടൂളുകൾ വീണ്ടും പ്രവർത്തിപ്പിക്കാൻ (re-run) വ്യക്തമായ അനുമതി നൽകിയാൽ അവയുടെ പിശകുകൾ തിരുത്താനുള്ള കഴിവ് ഗണ്യമായി വർദ്ധിക്കുമെന്ന് രചയിതാവ് കണ്ടെത്തി – ഒരു ചെറിയ വാചക മാറ്റം മാത്രം പിശക് തിരുത്തൽ വിജയശതമാനം 0.16-ൽ നിന്ന് 1.00 ആയി ഉയർത്തി. “action-licensing” എന്ന് വിളിക്കപ്പെടുന്ന ഈ ഫലം കാണിക്കുന്നത്, ഒരു ഏജന്റിനോട് അതിന്റെ ജോലി പരിശോധിക്കാൻ നിർദ്ദേശിക്കുന്നത് ലക്ഷ്യം വീണ്ടും പറയുന്നതിനേക്കാൾ എത്രത്തോളം ഫലപ്രദമാണെന്നാണ്.
ഈ പരിഹാരം പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്
AI അസിസ്റ്റന്റുകൾക്ക് പുറത്തുള്ള ടൂളുകൾ (databases, calculators, APIs) ഉപയോഗിക്കാൻ കഴിയുന്നത് ബിസിനസ്സ് പ്രവർത്തനങ്ങളിൽ (workflows) വർദ്ധിച്ചുവരുന്ന ഉപയോഗത്തിന് കാരണമാകുന്നു. ഇത്തരം ഏജന്റുകൾക്ക് പിശകുകൾ സംഭവിക്കുമ്പോൾ, ആ തെറ്റുകൾ പലപ്പോഴും തിരിച്ചറിയാനാകാതെ മുന്നോട്ട് പോകുകയും, വ്യക്തമായ പരാജയ സൂചനകളില്ലാതെ തെറ്റായ ഉത്തരങ്ങൾ നൽകുകയും ചെയ്യുന്നു. പ്രോംപ്റ്റ് (prompt) മുഴുവനായി മാറ്റാതെ തന്നെ ഇതിൽ ഇടപെടാനുള്ള വിശ്വസനീയമായ ഒരു മാർഗ്ഗം ഡെവലപ്പർമാരുടെ സമയം ലാഭിക്കാനും പ്രൊഡക്ഷൻ സിസ്റ്റങ്ങളിൽ വലിയ തെറ്റുകൾ ഒഴിവാക്കാനും സഹായിക്കും.
പരാജയങ്ങൾ എങ്ങനെ സംഭവിക്കുന്നു
രചയിതാവ് താഴെ പറയുന്ന രണ്ട് സാധാരണവും എന്നാൽ തിരിച്ചറിയാൻ പ്രയാസമുള്ളതുമായ പരാജയ രീതികൾ നിരീക്ഷിച്ചു:
Skipped Lookup – ഒരു വിവരം കണ്ടെത്തേണ്ടതുണ്ടെന്ന് ഏജന്റിന് അറിയാമെങ്കിലും (ഉദാഹരണത്തിന്, ഒരു ID-യിൽ നിന്ന് മാനേജരുടെ പേര് കണ്ടെത്തുക), ലുക്കപ്പ് ടൂൾ (lookup tool) ഉപയോഗിക്കുന്നതിന് പകരം ഏജന്റ് വെറുതെ ഒരു ഉത്തരം കെട്ടിച്ചമയ്ക്കുന്നു. പുറമെ നോക്കുമ്പോൾ ഉത്തരം ശരിയാണെന്ന് തോന്നുമെങ്കിലും അതിന് കൃത്യമായ വസ്തുതകൾ ഉണ്ടാകില്ല.
Validated Nonsense – ഏജന്റ് ഒരു ടൂളിലേക്ക് തെറ്റായതോ അസ്വാഭാവികമായതോ ആയ ഡാറ്റ നൽകുന്നു. ടൂൾ ഒരു പിശക് (error) കാണിക്കാതെ തന്നെ ഒരു ഫലം നൽകുന്നു, ഏജന്റ് ആ ഫലത്തെ ശരിയാണെന്ന് കരുതി സ്വീകരിക്കുന്നു. ഇത് ഏജന്റ് സ്വന്തം തെറ്റിനെ തന്നെ ശരിവെക്കുന്ന അവസ്ഥയാണ്.
ഈ രണ്ട് രീതികളും ഉപയോക്താവിന് ആത്മവിശ്വാസത്തോടെയുള്ള എന്നാൽ തെറ്റായ ഒരു ഉത്തരം നൽകുന്നു. കൂടാതെ, ഡെവലപ്പർമാർ ശ്രദ്ധിക്കുന്ന ലൂപ്പുകളോ (loops) മറുപടി ലഭിക്കാത്ത അവസ്ഥയോ ഇവ ഉണ്ടാക്കുന്നില്ല.
പരീക്ഷണം
വ്യത്യസ്ത പ്രോംപ്റ്റുകൾ പിശക് തിരുത്തലിനെ എങ്ങനെ ബാധിക്കുന്നു എന്ന് അളക്കുന്നതിനായി, കൃത്യമായ ഉത്തരങ്ങൾ (ground-truth answers) ഉപയോഗിച്ച് രചയിതാവ് ഒരു നിയന്ത്രിത പരീക്ഷണം നടത്തി (ഇവിടെ LLM അടിസ്ഥാനമാക്കിയുള്ള ഗ്രേഡിംഗ് ഉപയോഗിച്ചില്ല). രണ്ട് രീതികൾ തമ്മിൽ താരതമ്യം ചെയ്തു:
Goal-only nudge – “ഉത്തരം മാനേജരുടെ പേരാകണം.” വിജയശതമാനം (Recovery rate): 0.16.
Action-licensing nudge – “ഉത്തരം മാനേജരുടെ പേരാകണം. പരിശോധിക്കാൻ ടൂളുകൾ ഉപയോഗിക്കുക.” വിജയശതമാനം (Recovery rate): 1.00 (പരാജയപ്പെട്ട എല്ലാ പ്രാവശ്യങ്ങളും തിരുത്തപ്പെട്ടു).
ഒരു ടൂൾ വീണ്ടും പ്രവർത്തിപ്പിക്കാനുള്ള (re-execute) വ്യക്തമായ അനുമതി നൽകുക എന്നതായിരുന്നു ഇതിലെ ഏക വ്യത്യാസം. രണ്ടാമത്തെ പ്രോംപ്റ്റ് ഏജന്റിന് നൽകിയത്, തനിക്ക് പഴയത് ഉപേക്ഷിച്ച്, വിട്ടുപോയ വിവരങ്ങൾ വീണ്ടും ശേഖരിക്കാനും പഴയ ഊഹം തിരുത്തി പുതിയ ഉത്തരം നൽകാനും സാധിക്കുമെന്ന ബോധ്യം നൽകുകയായിരുന്നു. ഈ അനുമതി, പരാജയപ്പെട്ട പ്രാവശ്യങ്ങളെ പൂർണ്ണമായും പരിഹരിക്കാൻ സഹായിച്ചു.
ഈ കണക്കുകൾ എന്ത് സൂചിപ്പിക്കുന്നു
0.16-ൽ നിന്ന് 1.00 എന്നതിലേക്കുള്ള വർദ്ധനവ് സൂചിപ്പിക്കുന്നത്, പിശക് തിരുത്തുന്നതിന് തടസ്സമായത് ഏജന്റിന് ലക്ഷ്യത്തെക്കുറിച്ചുള്ള അറിവില്ലായ്മയല്ല, മറിച്ച് പ്രവർത്തിക്കാനുള്ള സ്വാതന്ത്ര്യക്കുറവാണ് എന്നാണ്. പ്രോംപ്റ്റിൽ “നിങ്ങൾക്ക് വീണ്ടും ശ്രമിക്കാം” എന്ന് പറയുമ്പോൾ, ഏജന്റ് ആ സാഹചര്യത്തെ ഒരു പരാജയമായി കാണുന്നതിന് പകരം പുതിയൊരു ഉപ-ദൗത്യമായി (sub-task) കാണുകയും ടൂൾ ഉപയോഗിക്കുന്ന പ്രക്രിയ വീണ്ടും തുടങ്ങുകയും ചെയ്യുന്നു.
പ്രോംപ്റ്റുകൾ കൊണ്ട് മാത്രം പരിഹരിക്കാൻ കഴിയാത്ത സാഹചര്യങ്ങൾ
പ്രോംപ്റ്റുകൾ കൊണ്ട് മാത്രം ഏജന്റിനെ രക്ഷിക്കാൻ കഴിയാത്ത ചില സാഹചര്യങ്ങളും ഈ പരീക്ഷണം ചൂണ്ടിക്കാട്ടുന്നു:
ഒരു ടൂൾ തെറ്റായ ഇൻപുട്ട് സ്വീകരിക്കുകയും ഒരു മൂല്യം (value) നൽകുകയും ചെയ്താൽ, ഡാറ്റ തെറ്റാണെന്ന സൂചന ഏജന്റിന് ലഭിക്കില്ല. എത്ര പ്രോംപ്റ്റുകൾ മാറ്റിയാലും ഈ പിശക് കണ്ടെത്താൻ കഴിയില്ല; ടൂൾ തന്നെ ഇൻപുട്ട് പരിശോധനയോ (input validation) പിശകുകൾ കാണിക്കുന്ന സംവിധാനമോ ഉണ്ടായിരിക്കണം.
ടൂളുകൾ ഉപയോഗിക്കാൻ തന്നെ പ്രയാസപ്പെടുന്ന ഏജന്റുകൾക്ക് “use tools” എന്ന നിർദ്ദേശം കൊണ്ട് ഗുണമുണ്ടാകില്ല, കാരണം അടിസ്ഥാനപരമായ കഴിവ് അവയ്ക്കുണ്ടാവില്ല. ഇത്തരം മോഡലുകളിൽ പിശക് തിരുത്തൽ പരീക്ഷിക്കുന്നത് പ്രോംപ്റ്റിന്റെ ഫലപ്രാപ്തിയെ മോഡലിന്റെ അടിസ്ഥാനപരമായ ടൂൾ ഉപയോഗിക്കാനുള്ള കഴിവിനോട് കലർത്തുന്നു.
ഡെവലപ്പർമാർക്കുള്ള പ്രായോഗിക നിർദ്ദേശങ്ങൾ
അനുമതി നൽകുക (Grant permission) – നിങ്ങൾ ഇടപെടുമ്പോൾ, ഒരു ടൂൾ വീണ്ടും ഉപയോഗിക്കാനോ കണക്കുകൂട്ടലുകൾ ആവർത്തിക്കാനോ ഏജന്റിന് വ്യക്തമായ അനുമതി നൽകുക. ലക്ഷ്യം മാത്രം വീണ്ടും പറയുന്നത് പലപ്പോഴും ഏജന്റിനെ പഴയ തെറ്റായ പാതയിൽ തന്നെ നിലനിർത്താൻ കാരണമാകും.
ടൂളുകൾ സുരക്ഷിതമാക്കുക (Guard the tools) – ഏജന്റ് ഉപയോഗിക്കുന്ന ടൂളുകളിൽ ഇൻപുട്ട് പരിശോധനകളും (input checks) വ്യക്തമായ എറർ മെസ്സേജുകളും ഉൾപ്പെടുത്തുക. ഇത് “validated nonsense” ഒഴിവാക്കാൻ സഹായിക്കും.
നേരത്തെ കണ്ടെത്തുക (Detect early) – ഒരു തെറ്റ് എത്ര നേരത്തെ കണ്ടെത്തുന്നുവോ, അത്രയും എളുപ്പത്തിൽ അത് തിരുത്താൻ സാധിക്കും. പ്രതീക്ഷിച്ച ടൂൾ ഉപയോഗവും യഥാർത്ഥ ഉപയോഗവും തമ്മിലുള്ള വ്യത്യാസം നിരീക്ഷിക്കുന്നത് ശരിയായ സമയത്ത് തിരുത്തൽ പ്രോംപ്റ്റുകൾ നൽകാൻ സഹായിക്കും.
മോഡലിന്റെ കഴിവുകൾ പരിശോധിക്കുക (Validate model capabilities) – പ്രോംപ്റ്റുകൾ ഉപയോഗിച്ച് പിശകുകൾ തിരുത്തുന്നതിന് മുൻപ്, മോഡലിന് ടൂളുകൾ കൃത്യമായി ഉപയോഗിക്കാൻ കഴിയുന്നുണ്ടെന്ന് ഉറപ്പുവരുത്തുക. അല്ലെങ്കിൽ നിങ്ങൾ പരിശോധിക്കുന്നത് ഒരു തകരാറുള്ള അടിത്തറയ്ക്ക് മേലുള്ള പ്രോംപ്റ്റിന്റെ ഫലപ്രാപ്തിയായിരിക്കും.
ചുരുക്കത്തിൽ: ഒരു AI ഏജന്റിന് അതിന്റെ ജോലി വീണ്ടും ചെയ്യാനുള്ള വ്യക്തമായ അനുമതി നൽകുന്നത് പകുതിവഴിയിൽ നിലച്ച ഒരു പരിഹാരത്തെ പൂർണ്ണമായ വിജയമാക്കി മാറ്റും. പ്രോംപ്റ്റ് ഡിസൈനർമാർ “use tools to verify” എന്ന നിർദ്ദേശത്തെ ഒരു അധിക സൗകര്യമായി കാണാതെ, ഒരു സുരക്ഷാ സംവിധാനമായി (safety valve) കാണണം.
