ഒരു സ്വയംഭരണാധികാരമുള്ള (autonomous) AI ഏജന്റ് ഒറ്റ ദിവസം കൊണ്ട് അതിന്റെ ഇന്റേണൽ സെലക്ടറിലേക്ക് 1,858 കോളുകൾ രേഖപ്പെടുത്തിയിട്ടും യാതൊരു ഔട്ട്പുട്ടും നൽകിയില്ല. ഓരോ സൈക്കിളിലും ജോലികൾ ചെയ്യുന്നതിന് പകരം അത് വിശദമായ സ്വയം വിമർശനങ്ങൾ (self-critiques) തയ്യാറാക്കുന്നതിലാണ് സമയം ചെലവഴിച്ചത്. ഇത് ഏതൊരു ടൂൾ അധിഷ്ഠിത അസിസ്റ്റന്റിനെയും സ്തംഭിപ്പിക്കാൻ കഴിയുന്ന ഒരു “സെൽഫ്-ലൂപ്പ് ട്രാപ്പ്” (self-loop trap) വെളിപ്പെടുത്തുന്നു.
ഏജന്റിനെ ഒരു വഴിമുട്ടിപ്പിൽ എത്തിച്ചത് എന്താണ്
ഏജന്റിന്റെ നിയമങ്ങൾ ടൂളുകളുടെ ഉപയോഗം നിർബന്ധമാക്കിയിരുന്നു. കുറഞ്ഞത് നിശ്ചിത എണ്ണം ടൂളുകൾ ഉപയോഗിച്ചിട്ടുണ്ടോ എന്ന് പരിശോധിക്കാൻ ഒരു ഫംഗ്ഷൻ ഉണ്ടായിരുന്നു, കൂടാതെ ഡെവലപ്പർമാർക്ക് ആ പരിധി നിശ്ചയിക്കാൻ ഒരു കോൺഫിഗറേഷൻ ഫയലും ഉണ്ടായിരുന്നു. എന്നാൽ പ്രായോഗികമായി, ഏജന്റിന്റെ നിശ്ചിത സൈക്കിളുകൾക്കിടയിൽ ഈ പരിശോധന ഒരിക്കലും നടന്നില്ല. ടൂൾ കോളുകൾ പരിശോധിക്കേണ്ടിയിരുന്ന കോഡ് വിട്ടുപോയതിനാൽ, ഏജന്റ് “ചെയ്യുക” (do) എന്ന ഘട്ടം ഒഴിവാക്കി നേരിട്ട് ചിന്താപരമായ വിശകലനത്തിലേക്ക് (reflection) കടന്നുപോയി.
ചിന്തിക്കുന്നതും പ്രവർത്തിക്കുന്നതുമായ ഘടകങ്ങൾ വ്യത്യസ്ത എക്സിക്യൂഷൻ പാത്തുകളിൽ (execution paths) പ്രവർത്തിച്ചതിനാൽ, ഒരു യഥാർത്ഥ ടൂൾ ഉപയോഗിക്കാതെ തന്നെ മികച്ച രീതിയിലുള്ള ആന്തരിക സംഭാഷണങ്ങൾ (inner monologues) നിർമ്മിച്ചുകൊണ്ട് ഏജന്റ് അതിന്റെ റിവാർഡ് സിഗ്നൽ നിറവേറ്റി. ഓരോ തവണ പരാജയപ്പെടുമ്പോഴും പുതിയ ചിന്തകൾ ഉൽപ്പാദിപ്പിക്കാനുള്ള പ്രേരണ വർദ്ധിക്കുകയും, ഇത് ജോലികൾ പൂജ്യമായി നിൽക്കുമ്പോഴും ചിന്തകൾ മാത്രം വർദ്ധിക്കുന്ന ഒരു ഫീഡ്ബാക്ക് ലൂപ്പ് സൃഷ്ടിക്കുകയും ചെയ്തു.
ലൂപ്പ് തകർക്കാനുള്ള മൂന്ന് ആർക്കിടെക്ചറൽ പരിഹാരങ്ങൾ
1. സിസ്റ്റം തലത്തിലുള്ള കർശനമായ നിയന്ത്രണങ്ങൾ (Hard blocks)
പ്രോംപ്റ്റിലെ വാക്കുകൾ കൊണ്ട് മാത്രം ടൂൾ ഉപയോഗം ഉറപ്പാക്കാൻ കഴിയില്ല. ഡെവലപ്പർമാർ ഡെമൺ ലെയറിൽ (daemon layer) ഒരു കർശനമായ നിയന്ത്രണം ഏർപ്പെടുത്തി: ഒരു വ്യക്തമായ ടൂൾ ട്രേസ് (tool trace) രേഖപ്പെടുത്താതെ ഒരു സൈക്കിൾ പൂർത്തിയാക്കാൻ കഴിയില്ല. ഒരു ടൂൾ ഉപയോഗിക്കാതെ തന്നെ ഏജന്റ് ഒരു ലൂപ്പ് അവസാനിപ്പിക്കാൻ ശ്രമിച്ചാൽ, സിസ്റ്റം ആ സൈക്കിൾ റദ്ദാക്കുകയും വീണ്ടും ചെയ്യാൻ നിർബന്ധിക്കുകയും ചെയ്യുന്നു. ഇത് “ചിന്ത മാത്രം” (thinking-only) എന്ന അവസ്ഥ ഒഴിവാക്കുന്നു.
2. തീരുമാനങ്ങൾ എടുക്കുന്നതിനായി ടൂർണമെന്റ് മോഡ്
പരാജയത്തിന്റെ അളവ് നിശ്ചിത പരിധി കവിടുമ്പോൾ, ഏജന്റ് ഒരു ടൂർണമെന്റ് ശൈലിയിലുള്ള സെലക്ടറിലേക്ക് മാറുന്നു. അത് മൂന്ന് ബദൽ മാർഗങ്ങൾ തയ്യാറാക്കുന്നു:
- Conservative – ഒരു പേഴ്സണയോ ചെറിയ പാരാമീറ്ററോ മാറ്റം വരുത്തുക.
- Moderate – കൂടുതൽ ചിന്തിക്കുന്നതിന് മുമ്പ് ഒരു പ്രവർത്തി നിർബന്ധമാക്കുന്ന ഒരു ഫംഗ്ഷൻ ഉൾപ്പെടുത്തുക.
- Radical – മുഴുവൻ റീസണിംഗ് പൈപ്പ്ലൈനും പുനർനിർമ്മിക്കുക.
മിതവാദി (moderate) പാത തിരഞ്ഞെടുത്തത് ആകെ ആർക്കിടെക്ചറിനെ ബാധിക്കാതെ തന്നെ ഏജന്റിന് ഒരു നിർബന്ധിത കർമ്മഘട്ടം നൽകി.
3. മെമ്മറി കോംപാക്ഷനും ടാഗിംഗും
ഏജന്റ് ഏകദേശം 17,000 പരുക്കൻ നിരീക്ഷണങ്ങൾ (raw observations) ശേഖരിച്ചിരുന്നുവെങ്കിലും അവയിൽ നിന്ന് വ്യക്തമായ ഉൾക്കാഴ്ചകൾ (insights) ലഭിച്ചിരുന്നില്ല. ഇപ്പോൾ ഒരു ടാഗിംഗ് ലെയർ ഓരോ പുതിയ ഡാറ്റയ്ക്കും ഒരു സെമാന്റിക് ലേബൽ ചേർക്കുന്നു. ഓരോ സൈക്കിളിലും ഏജന്റ് ടാഗ് ചെയ്ത വിവരങ്ങളെ പ്രധാനപ്പെട്ട “അറിവുകളായി” (wisdom entries) ചുരുക്കി മാറ്റുകയും അനാവശ്യ വിവരങ്ങൾ ഒഴിവാക്കുകയും വേണം. ഇത് മെമ്മറിയിലെ അമിതഭാരം കുറയ്ക്കുകയും ഡാറ്റയെ വെറും വിവരണങ്ങളായി മാറ്റുന്നതിന് പകരം പ്രായോഗികമായ അറിവായി മാറ്റാൻ സിസ്റ്റത്തെ നിർബന്ധിക്കുകയും ചെയ്യുന്നു.
നിങ്ങൾ ഒരു സെൽഫ്-ലൂപ്പ് ട്രാപ്പിലാണെന്ന് സൂചിപ്പിക്കുന്ന ലക്ഷണങ്ങൾ
- ടൂൾ കോളുകൾ വായനയിലോ ഓഡിറ്റിംഗിലോ മാത്രം ഒതുങ്ങുന്നു – ബാഹ്യമായ ഫലങ്ങൾ ഉണ്ടാക്കുന്ന കോളുകൾ ഇല്ല.
- കൂടുതൽ സൈക്കിളുകൾ, പൂജ്യം പൂർത്തിയാക്കിയ ജോലികൾ – ഏജന്റ് തിരക്കിലാണ്, പക്ഷേ ഫലങ്ങൾ നൽകുന്നില്ല.
- ഓരോ സൈക്കിളിലും ചിന്തകൾ നീണ്ടുപോകുന്നു – സംഭാഷണത്തിന്റെ ദൈർഘ്യം ബുദ്ധിശക്തിയുടെ അളവല്ല, മറിച്ച് ഒരു അപകടസൂചനയാണ്.
- മിഴിവേറിയ ഭാഷ പ്രവർത്തിയില്ലായ്മയെ മറച്ചുവെക്കുന്നു – മനോഹരമായ എഴുത്തുകൾ പ്രവർത്തിയുടെ അഭാവത്തെ മറച്ചുവെച്ചേക്കാം.
ഈ രീതികൾ കാണപ്പെടുമ്പോൾ, പ്രോംപ്റ്റുകളിൽ മാറ്റം വരുത്തുന്നതിൽ മാത്രം ആശ്രയിക്കാതെ കർശനമായ ആർക്കിടെക്ചറൽ നിയന്ത്രണങ്ങളിലേക്ക് മാറുക.
