ഒരു പുതിയ “proactive memory” മോഡ്യൂൾ, കോർ മോഡലിനെ ഫൈൻ ട്യൂൺ ചെയ്യാതെ തന്നെ ലാർജ് ലാംഗ്വേജ് മോഡൽ (LLM) ഏജന്റുകളെ ടാസ്ക് ആവശ്യകതകൾ, പരിസ്ഥിതി വസ്തുതകൾ, മുൻകാല പരാജയങ്ങൾ എന്നിവ ട്രാക്ക് ചെയ്യാൻ സഹായിക്കുന്നു. ബെഞ്ച്മാർക്ക് ടെസ്റ്റുകളിൽ, ഈ കൂട്ടിച്ചേർക്കൽ Terminal-Bench 2.0-ൽ Sonnet 4.5-ന്റെ സ്കോർ 8.3 ശതമാനവും, τ2-Bench സ്യൂട്ടിൽ 6.8 പോയിന്റും വർദ്ധിപ്പിച്ചു; SETA ഉപയോഗിച്ച് പരിശീലിപ്പിച്ച ഒരു മെമ്മറി ഏജന്റ്, പുതിയ പ്രശ്നങ്ങളിൽ (unseen problems) ഒരു ഫ്രോസൺ മോഡലിന്റെ pass@1 37.6%-ൽ നിന്ന് 41.1%-ലേക്ക് ഉയർത്തി.
എന്തുകൊണ്ടാണ് ഏജന്റുകൾക്ക് ലക്ഷ്യത്തിൽ നിന്ന് വ്യതിചലിക്കാൻ സാധിക്കുന്നത്?
ഒരു LLM അധിഷ്ഠിത ഏജന്റ് ബഹുതല നടപടിക്രമങ്ങൾ (multi-step procedure) പിന്തുടരുമ്പോൾ, അതിന്റെ ആന്തരികമായ “state” നശിക്കുന്നു (decays). ഗവേഷകർ ഇതിനെ “behavioral state decay” എന്ന് വിളിക്കുന്നു: മോഡൽ മുൻപത്തെ നിർദ്ദേശങ്ങളോ, പ്രധാനപ്പെട്ട വസ്തുതകളോ, അല്ലെങ്കിൽ നേരത്തെ ചെയ്ത തെറ്റുകളോ മറന്നുപോകുന്നു. ഇതിന്റെ ഫലമായി മോഡൽ തെറ്റായ തീരുമാനങ്ങൾ എടുക്കുകയും ടാസ്ക് പൂർത്തിയാകുന്നതിന് വളരെ മുമ്പ് തന്നെ അത് പരാജയപ്പെടുകയും ചെയ്യുന്നു.
കോൺടെക്സ്റ്റ് വിൻഡോ (context window)—അതായത് മോഡലിന് ഒരേസമയം ശ്രദ്ധിക്കാൻ കഴിയുന്ന ടെക്സ്റ്റ് ഭാഗം—വലുതാക്കുക എന്നതാണ് സാധാരണയായി ചെയ്യുന്ന പരിഹാരം. എന്നാൽ ടാസ്ക് ആ വിൻഡോയുടെ പരിധിക്കപ്പുറത്തേക്ക് വളരുന്നതുവരെ മാത്രമേ ഇത് സഹായിക്കുകയുള്ളൂ; പഴയ വിവരങ്ങൾ ഒഴിവാക്കപ്പെടുകയും വീണ്ടും ഡികേ (decay) സംഭവിക്കുകയും ചെയ്യുന്നു.
ആവശ്യമുള്ളപ്പോൾ മാത്രം പ്രവർത്തിക്കുന്ന ഒരു ഓർമ്മപ്പെടുത്തൽ
പുതിയ രീതിയിൽ, മെയിൻ മോഡലിന്റെ റീസണിംഗ് ട്രാസ് (reasoning trace) നിരീക്ഷിക്കുകയും കൃത്യമായ ഓർമ്മപ്പെടുത്തലുകൾ നൽകുകയും ചെയ്യുന്ന ഒരു ഭാരം കുറഞ്ഞ (lightweight) ഓക്സിലറി മെമ്മറി ഏജന്റിനെ ചേർക്കുന്നു. പഴയ വിവരങ്ങളുടെ ഒരു സ്ഥിരമായ പട്ടിക നൽകുന്നതിന് പകരം, മെമ്മറി മോഡ്യൂൾ എപ്പോൾ, എന്ത് വിവരങ്ങൾ നൽകണമെന്ന് തീരുമാനിക്കുന്നു; മെയിൻ മോഡൽ ലക്ഷ്യത്തിൽ നിന്ന് വ്യതിചലിക്കുന്നു എന്ന് തോന്നുമ്പോൾ മാത്രമാണ് ഇത് പ്രവർത്തിക്കുന്നത്.
മെമ്മറി ലേണർ പ്രത്യേകം പരിശീലിപ്പിക്കപ്പെടുന്നതിനാൽ, പ്രൈമറി ആക്ഷൻ മോഡൽ ഫ്രോസൺ (frozen) ആയി തുടരുന്നു. ഈ വേർതിരിവ് ലോങ്ങ്-ഹൊറൈസൺ ബെഞ്ച്മാർക്കുകളിൽ (long-horizon benchmarks) ഗണ്യമായ നേട്ടങ്ങൾ നൽകുന്നുണ്ടെന്ന് പഠനം കാണിക്കുന്നു, ഇത് പ്രോആക്റ്റീവ് റിമൈൻഡറുകൾക്ക് പരിമിതമായ കോൺടെക്സ്റ്റ് വിൻഡോയെ പരിഹരിക്കാൻ കഴിയുമെന്ന് തെളിയിക്കുന്നു.
കണക്കുകൾ എന്ത് പറയുന്നു?
- Terminal-Bench 2.0: Sonnet 4.5 അതിന്റെ ബേസ്ലൈനിനേക്കാൾ 8.3 പോയിന്റ് ഉയരുന്നു.
- τ2-Bench suite: ഇതേ മോഡലിന് 6.8 പോയിന്റ് പുരോഗതിയുണ്ട്.
- Held-out ടെസ്റ്റുകളിലെ Pass@1: SETA ഉപയോഗിച്ച് പരിശീലിപ്പിച്ച ഒരു മെമ്മറി ഏജന്റ് ഒരു ഫ്രോസൺ മോഡലിനെ 37.6%-ൽ നിന്ന് 41.1%-ലേക്ക് ഉയർത്തുന്നു.
മെയിൻ മോഡലിനെ അധികമായി ഫൈൻ ട്യൂൺ ചെയ്യാതെ തന്നെ ഈ വർദ്ധനവ് സംഭവിക്കുന്നു, അതിനാൽ നിലവിലുള്ള സംവിധാനങ്ങളിൽ നിന്ന് മെമ്മറി ഘടകത്തെ എളുപ്പത്തിൽ മാറ്റാനോ ചേർക്കാനോ സാധിക്കും.
നിലവിലെ പഠനത്തിന്റെ പരിമിതികൾ
പരീക്ഷണങ്ങൾ താഴെ പറയുന്നവ പരിശോധിക്കാതെ നിർത്തുന്നു:
- സ്കെയിൽ (Scale): മൾട്ടി-ബില്യൺ പാരാമീറ്റർ മോഡലുകളിലോ ദശലക്ഷക്കണക്കിന് സ്റ്റെപ്പുകൾ നീണ്ടുനിൽക്കുന്ന ടാസ്ക്കുകളിലോ മെമ്മറി മോഡ്യൂൾ ഇതേപോലെ പ്രവർത്തിക്കുമെന്ന് ഇതുവരെ തെളിയിക്കപ്പെട്ടിട്ടില്ല.
- പ്രൊഡക്ഷൻ ചിലവ് (Production cost): ഓർമ്മപ്പെടുത്തലുകൾ സംഭരിക്കുകയും വീണ്ടെടുക്കുകയും ചെയ്യുന്നത് അധിക ചിലവ് (overhead) ഉണ്ടാക്കുന്നുണ്ടെങ്കിലും, ഒരു യഥാർത്ഥ സിസ്റ്റത്തിൽ ഇതിനായി എത്ര അധിക മെമ്മറിയോ കമ്പ്യൂട്ട് പവർ വേണമെന്നതിനെക്കുറിച്ച് പഠനം കൃത്യമായി കണക്കാക്കുന്നില്ല.
ഇനി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ
ഭാവിയിലെ ബെഞ്ച്മാർക്ക് സ്യൂട്ടുകൾ വെറും കോൺടെക്സ്റ്റ് സൈസ് മാത്രം അളന്നാൽ പോരാ. സ്റ്റേറ്റ് ഡികേ (state decay) കൃത്യമായി ട്രാക്ക് ചെയ്യുന്നതും ആക്റ്റീവ് റിമൈൻഡർ സിസ്റ്റങ്ങളെ പ്രോത്സാഹിപ്പിക്കുന്നതുമായ ടെസ്റ്റുകൾ ഏജന്റുകളുടെ ദീർഘകാല വിശ്വാസ്യതയെക്കുറിച്ച് വ്യക്തമായ ചിത്രം നൽകും. കൂടാതെ, മോഡൽ വലുപ്പത്തിലും പ്രവർത്തന ചിലവിലും പ്രോആക്റ്റീവ് മെമ്മറി കാര്യക്ഷമമായി പ്രവർത്തിക്കുന്നുണ്ടെന്ന് ഗവേഷകർ തെളിയിക്കേണ്ടതുണ്ട്.
ചുരുക്കത്തിൽ: പ്രത്യേകം പരിശീലിപ്പിച്ച ചെറിയൊരു മെമ്മറി മോഡ്യൂളിന് ലാർജ് ലാംഗ്വേജ് മോഡൽ ഏജന്റുകളുടെ ഒരു വാച്ച്ഡോഗ് (watchdog) ആയി പ്രവർത്തിക്കാനും, ടാസ്ക് പരാജയപ്പെടുന്നതിന് മുമ്പ് തന്നെ വ്യതിചലനങ്ങൾ കണ്ടെത്തി തിരുത്താനും സാധിക്കും.
