ഗവേഷകരായ Yuxing Lu, Yicheng Chen, Shanchan Wu എന്നിവർ ഒരു “Procedural Graph” ഫ്രെയിംവർക്ക് പുറത്തിറക്കി. ഇത് ലാർജ് ലാംഗ്വേജ് മോഡൽ (LLM) ഏജന്റുകൾക്ക് തങ്ങൾ ജോലി ചെയ്യുന്നതിനിടെ സ്വന്തം ടാസ്ക്-എക്സിക്യൂഷൻ പ്ലാനുകൾ (task-execution plans) മാറ്റിയെഴുതാൻ അനുവദിക്കുന്നു.

ഇന്നത്തെ ഏജന്റുകളുടെ പ്രശ്നങ്ങൾ

മിക്ക LLM അധിഷ്ഠിത അസിസ്റ്റന്റുകളും ഒരു പാചകക്കുറിപ്പ് വായിച്ചു കേൾപ്പിക്കാൻ മാത്രം അറിയാവുന്ന ഒരു ഷെഫിനെപ്പോലെയാണ് പ്രവർത്തിക്കുന്നത്. മോഡൽ ഘട്ടങ്ങൾ താൽക്കാലിക മെമ്മറിയിൽ (transient memory) സൂക്ഷിക്കുന്നു, അടുത്ത ടൂൾ തിരഞ്ഞെടുക്കുന്നു, അടുത്ത ടോക്കൺ ശരിയായി വരും എന്ന് പ്രതീക്ഷിക്കുന്നു. പ്രായോഗികമായി മൂന്ന് പരാജയങ്ങൾ പലപ്പോഴും സംഭവിക്കാറുണ്ട്:

  • ലക്ഷ്യത്തിൽ നിന്നുള്ള വ്യതിയാനം (Goal drift) – ഏതാനും ഘട്ടങ്ങൾക്ക് ശേഷം ഏജന്റ് അതിന്റെ യഥാർത്ഥ ലക്ഷ്യം മറന്നുപോകുന്നു.
  • ടൂളുകളുടെ ദുരുപയോഗം (Tool misuse) – ഇത് ഒരു API തെറ്റായ ക്രമത്തിൽ വിളിക്കുന്നു അല്ലെങ്കിൽ ഒരേ കോൾ തന്നെ ആവർത്തിക്കുന്നു (loops).
  • പഠിച്ചെടുക്കാത്ത തെറ്റുകൾ (Unlearned mistakes) – പരാജയങ്ങൾ സ്ഥിരമായി രേഖപ്പെടുത്താത്തതിനാൽ, ബന്ധമില്ലാത്ത സെഷനുകളിലും ഒരേ തെറ്റ് തന്നെ വീണ്ടും സംഭവിക്കുന്നു.

യുക്തിസഹമായ ചിന്താഗതി (reasoning) വ്യക്തമല്ലാത്തതിനാൽ (implicit), ഒരു പ്രവൃത്തി എന്തുകൊണ്ട് സംഭവിച്ചു എന്ന് ഡെവലപ്പർമാർക്ക് കാണാൻ കഴിയില്ല, കൂടാതെ സിസ്റ്റമാറ്റിക് ആയ പിഴവുകൾ തിരുത്താനും ഉപയോക്താക്കൾക്ക് സാധിക്കില്ല.

പ്രോംപ്റ്റുകളെ ഒരു ഗ്രാഫാക്കി മാറ്റുന്നു

Procedural Graphs “മെമ്മറി-ഒൺലി” സമീപനത്തിന് പകരം വ്യക്തവും എഡിറ്റ് ചെയ്യാവുന്നതുമായ ഒരു ഘടന ഉപയോഗിക്കുന്നു. ഈ ഫ്രെയിംവർക്ക് മൂന്ന് പ്രധാന ഘടകങ്ങളെ നിർവചിക്കുന്നു:

ഘടകം പങ്ക്
Node “ഫ്ലൈറ്റ് തിരയുക” അല്ലെങ്കിൽ “പേയ്‌മെന്റ് പരിശോധിക്കുക” തുടങ്ങിയ കൃത്യമായ ഒരു ഘട്ടം.
Edge നോഡുകൾ തമ്മിലുള്ള ഒഴുക്ക് – നേർരേഖയിലുള്ള ക്രമങ്ങൾ, കണ്ടിഷണൽ ബ്രാഞ്ചുകൾ (if/then), ലൂപ്പുകൾ എന്നിവ.
Attribute ഒരു നോഡുമായോ എഡ്ജുമായോ ബന്ധപ്പെട്ട മെറ്റാഡാറ്റ, ഉദാഹരണത്തിന്: വിജയ നിരക്ക്, ശരാശരി എക്സിക്യൂഷൻ സമയം, അല്ലെങ്കിൽ കോൺഫിഡൻസ് സ്കോർ.

ഒരു LLM ഏജന്റിന് ഒരു അഭ്യർത്ഥന ലഭിക്കുമ്പോൾ, അത് ആദ്യം ആ അഭ്യർത്ഥനയെ നിലവിലുള്ള ഒരു ഗ്രാഫുമായി ബന്ധിപ്പിക്കുന്നു അല്ലെങ്കിൽ പുതിയൊരെണ്ണം ഉടൻ നിർമ്മിക്കുന്നു. തുടർന്ന് എക്സിക്യൂഷൻ എഡ്ജുകൾ പിന്തുടരുകയും, ടൂളുകൾ ഉപയോഗിക്കുകയും, ഫലങ്ങൾ അറ്റാരിബ്യൂട്ടുകളിൽ (attributes) സൂക്ഷിക്കുകയും ചെയ്യുന്നു. ഗ്രാഫ് മോഡലിന്റെ ടോക്കൺ സ്ട്രീമിന് പുറത്തായതുകൊണ്ട്, ആളുകൾക്ക് അത് പരിശോധിക്കാനും വിഷ്വലൈസ് ചെയ്യാനും എഡിറ്റ് ചെയ്യാനും സാധിക്കും.

അഞ്ച് ഘട്ടങ്ങളിലൂടെയുള്ള സ്വയം പരിണാമം (Self-evolution)

ഏജന്റിന് സ്വന്തം ഗ്രാഫ് മെച്ചപ്പെടുത്താൻ സഹായിക്കുന്ന ഒരു ലൂപ്പിലാണ് ഇതിന്റെ പുതുമ അടങ്ങിയിരിക്കുന്നത്:

  1. രേഖപ്പെടുത്തുക (Record): ഏജന്റ് സഞ്ചരിക്കുന്ന ഓരോ പാത്തും ഇൻപുട്ടുകൾ, ടൂൾ കോളുകൾ, ഫലങ്ങൾ എന്നിവ സഹിതം രേഖപ്പെടുത്തുക.
  2. താരതമ്യം ചെയ്യുക (Compare): വിജയകരമായ പാത്തുകളെ പരാജയപ്പെട്ടവയുമായി താരതമ്യം ചെയ്ത് അവ എവിടെയാണ് വ്യത്യാസപ്പെട്ടിരിക്കുന്നത് എന്ന് കണ്ടെത്തുക.
  3. പരിശോധിക്കുക (Diagnose): നോഡ് അറ്റാരിബ്യൂട്ടുകളും (ഉദാഹരണത്തിന്: കുറഞ്ഞ വിജയ നിരക്ക്) എഡ്ജ് കണ്ടീഷനുകളും പരിശോധിച്ചുകൊണ്ട് തെറ്റ് കണ്ടെത്തുക.
  4. മാറ്റങ്ങൾ നിർദ്ദേശിക്കുക (Propose): പരാജയ വിശകലനം ലഭിച്ച ശേഷം LLM ഗ്രാഫിൽ വരുത്തേണ്ട മാറ്റങ്ങൾ നിർദ്ദേശിക്കുന്നു (വിട്ടുപോയ ഒരു വാലിഡേഷൻ ഘട്ടം ചേർക്കുക, അനാവശ്യമായ ഒരു ലൂപ്പ് ഒഴിവാക്കുക, ഒരു കണ്ടീഷൻ കൂടുതൽ കർശനമാക്കുക).
  5. സ്ഥിരീകരിക്കുക (Validate): പരിഷ്കരിച്ച ഗ്രാഫ് ഒരു ടെസ്റ്റ് ഇൻസ്റ്റൻസിൽ പരിശോധിക്കുക; പ്രകടനം മെച്ചപ്പെട്ടാൽ ആ മാറ്റം നിലനിർത്തുന്നു.

ഗ്രാഫ് ഒരു ഏകീകൃത സ്രോതസ്സായി (single source of truth) പ്രവർത്തിക്കുന്നതിനാൽ, മനുഷ്യസഹായമില്ലാതെ തന്നെ ഏജന്റിന് പുതിയ ഘട്ടങ്ങൾ ചേർക്കാനോ, ഫലമില്ലാത്ത വഴികൾ ഒഴിവാക്കാനോ, ലോജിക് മാറ്റാനോ സാധിക്കും. മനുഷ്യൻ തയ്യാറാക്കിയ ഒരു മോശം വർക്ക്ഫ്ലോ പോലും കാലക്രമേണ സ്വയം പരിഷ്കരിക്കപ്പെടും.

ഈ മാറ്റം പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്

മനഃപാഠമാക്കുന്നതിനും അപ്പുറമുള്ള സാമാന്യവൽക്കരണം (Generalization)

ഒരു സ്റ്റാറ്റിക് പ്രോംപ്റ്റിന് ഒരു ടാസ്ക് ഇൻസ്റ്റൻസ് മാത്രമേ ഉൾക്കൊള്ളാൻ കഴിയൂ. എന്നാൽ ഒരു ഗ്രാഫ് ഒരു വിഭാഗത്തിന്റെ മുഴുവൻ "എങ്ങനെ ചെയ്യണം" (how-to) എന്ന രീതിയെ സംഗ്രഹിക്കുന്നു—സെർച്ച് ആൻഡ് ബുക്ക്, ഡാറ്റാ എൻട്രി പൈപ്പ്‌ലൈനുകൾ, ട്രബിൾഷൂട്ടിംഗ് ഡയലോഗുകൾ എന്നിങ്ങനെ—അതുകൊണ്ട് ഒരേ ഘടന തന്നെ വ്യത്യസ്ത പാരാമീറ്ററുകൾ ഉപയോഗിച്ച് പ്രവർത്തിപ്പിക്കാം. ഓരോ മാറ്റത്തിനും ഓരോ പ്രോംപ്റ്റുകൾ നൽകേണ്ട ആവശ്യം ടീമുകൾക്ക് ഇനി ഉണ്ടാകില്ല.

സുതാര്യമായ തീരുമാനമെടുക്കൽ

ഗ്രാഫ് ഒരു ഫ്ലോചാർട്ട് പോലെയാണ് കാണപ്പെടുന്നത്. ഏത് നോഡാണ് ഒരു ടൂൾ കോളിന് കാരണമായതെന്നും എന്തുകൊണ്ടാണ് ഒരു പ്രത്യേക ബ്രാഞ്ച് തിരഞ്ഞെടുത്തതെന്നും സ്റ്റേക്ക്‌ഹോൾഡർമാർക്ക് കൃത്യമായി മനസ്സിലാക്കാൻ സാധിക്കും.

ന്യൂറോ-സിംബോളിക് സിനർജി (Neuro-symbolic synergy)

Procedural Graphs ഡീപ് ലേണിംഗ് പാറ്റേൺ റെക്കഗ്നിഷനെയും (LLM-ന്റെ ഭാഷാപരമായ ധാരണ) സിംബോളിക് റീസണിംഗിനെയും (വ്യക്തമായ ഗ്രാഫ് ലോജിക്) തമ്മിൽ യോജിപ്പിക്കുന്നു. ഘട്ടങ്ങൾ നിർമ്മിക്കാനോ മാറ്റാനോ ഉള്ള ഉൾക്കാഴ്ച (intuition) LLM നൽകുന്നു; ഗ്രാഫ് ലോജിക്കൽ സ്ഥിരത ഉറപ്പാക്കുന്നു. ഇതിനെ LLM-കൾക്ക് ഒരു “System 2” മസ്തിഷ്കം നൽകുന്നതായി രചയിതാക്കൾ വിവരിക്കുന്നു—അതായത് വേഗത്തിലുള്ള, അസോസിയേറ്റീവ് ആയ “System 1” ടോക്കൺ പ്രെഡിക്ഷന് പൂരകമായി പ്രവർത്തിക്കുന്ന, ബോധപൂർവ്വവും പരിശോധിക്കാവുന്നതുമായ ഒരു കൺട്രോളർ.

ചുരുക്കത്തിൽ

ഓരോ എക്സിക്യൂഷനിൽ നിന്നും പഠിക്കാൻ സഹായിക്കുന്ന, മാറ്റം വരുത്താവുന്നതും പരിശോധിക്കാവുന്നതുമായ ഒരു നട്ടെല്ല് Procedural Graphs LLM ഏജന്റുകൾക്ക് നൽകുന്നു. താൽക്കാലികമായ പ്രോംപ്റ്റുകളെ സ്ഥിരമായ ഘടനകളാക്കി മാറ്റുന്നതിലൂടെ, തകരാറുകൾ സംഭവിക്കാൻ സാധ്യത കുറഞ്ഞതും, മനസ്സിലാക്കാൻ എളുപ്പമുള്ളതും, പുതിയ വെല്ലുവിളികളോട് വേഗത്തിൽ പൊരുത്തപ്പെടാൻ കഴിയുന്നതുമായ AI അസിസ്റ്റന്റുകളെ ഈ സമീപനം വാഗ്ദാനം ചെയ്യുന്നു.