SEED പേപ്പറിന്റെ രചയിതാക്കൾ, reinforcement-learning (RL) ഏജന്റുകൾക്ക് അവരുടെ പരാജയങ്ങളുടെ ലോഗുകൾ (failure logs) പുതിയ പരിശീലന ഡാറ്റയാക്കി മാറ്റാൻ സഹായിക്കുന്ന ഒരു രീതി അവതരിപ്പിച്ചു. ഇത് ALFWorld ബെഞ്ച്മാർക്കിലെ ശരാശരി സ്കോർ 91.8 ആയി ഉയർത്തുകയും പരിശീലന ഡാറ്റയുടെ അളവ് ഏകദേശം 40% കുറയ്ക്കുകയും ചെയ്യുന്നു. ഇതേ സാങ്കേതികവിദ്യ ഉപയോഗിച്ച് ഏജന്റുകൾ ഇതുവരെ കാണാത്ത ടാസ്ക്കുകളിൽ 15.3 പോയിന്റുകളുടെ വർദ്ധനവ് ഉണ്ടായിട്ടുണ്ട്, ഇത് അധികമായി മനുഷ്യർ എഴുതിയ നിർദ്ദേശങ്ങൾ ഇല്ലാതെ തന്നെ ഒരു മോഡലിന് അതിന്റെ തെറ്റുകളിൽ നിന്ന് പഠിക്കാൻ കഴിയുമെന്ന് തെളിയിക്കുന്നു.

വെറുമൊരു പാസ്/ഫെയിൽ ഫ്ലാഗിനേക്കാൾ കൂടുതൽ RL ഏജന്റുകൾക്ക് എന്തുകൊണ്ട് ആവശ്യമാണ്

സാധാരണ RL ക്രമീകരണങ്ങളിൽ ഒരു നീണ്ട എപ്പിസോഡിന്റെ അവസാനം മാത്രമാണ് ഏജന്റിന് റിവാർഡ് നൽകുന്നത്. ഫലം തെറ്റാണെന്ന് ഈ സിഗ്നൽ സിസ്റ്റത്തെ അറിയിക്കുന്നുണ്ടെങ്കിലും, എവിടെയാണ് തെറ്റ് സംഭവിച്ചത് എന്നതിനെക്കുറിച്ച് ഒന്നും പറയുന്നില്ല. പത്ത് ഘട്ടങ്ങൾക്ക് മുമ്പ് ഒരു തെറ്റ് സംഭവിച്ചിട്ടുണ്ടെങ്കിൽ—ഒരുപക്ഷേ തെറ്റായ സെർച്ച് ടേം നൽകിയതോ അല്ലെങ്കിൽ തെറ്റായ ഫയൽ തുറന്നതോ ആണെങ്കിൽ—അവസാനത്തെ ബൈനറി സിഗ്നൽ ഇടയിലുള്ള എല്ലാ വിവരങ്ങളും ഒഴിവാക്കുന്നു. ഈ നഷ്ടം കാരണം, പരാജയത്തിലേക്ക് നയിക്കുന്ന അപൂർവ്വ പാറ്റേണുകൾ കണ്ടെത്താൻ ഗവേഷകർക്ക് വൻതോതിലുള്ള എപ്പിസോഡുകൾ ശേഖരിക്കേണ്ടി വരുന്നു.

SEED എങ്ങനെയാണ് ഫീഡ്‌ബാക്ക് ലൂപ്പ് മാറ്റുന്നത്

SEED (Self-Evolving On-Policy Distillation) ഓരോ എപ്പിസോഡിന് ശേഷവും രണ്ടാമതൊരു ലേണിംഗ് പാസ് കൂടി ചേർക്കുന്നു:

  1. ടാസ്ക് പൂർത്തിയാക്കുക – ഏജന്റ് ടാസ്ക് പൂർത്തിയാക്കുന്നു, സാധാരണ വിജയ/പരാജയ ലേബൽ ലഭിക്കുന്നു.
  2. സ്വന്തം ട്രാൻസ്ക്രിപ്റ്റ് വായിക്കുക – പ്രവർത്തനങ്ങളുടെയും നിരീക്ഷണങ്ങളുടെയും ഇടക്കാല തീരുമാനങ്ങളുടെയും ക്രമം മോഡലിന് തിരികെ നൽകുന്നു.
  3. സ്വാഭാവിക ഭാഷയിലുള്ള പാഠങ്ങൾ എഴുതുക – എന്താണ് തെറ്റായതെന്ന് വിശദീകരിക്കുന്ന ചെറിയ വാക്യങ്ങൾ മോഡൽ നിർമ്മിക്കുന്നു, ഉദാഹരണത്തിന്, “'X' എന്ന സെർച്ച് ടേം പ്രസക്തമല്ലാത്ത ഫലങ്ങൾ നൽകി” അല്ലെങ്കിൽ "'Z'-ന് പകരം 'Y' എന്ന ഫയൽ തുറന്നു".
  4. പാഠങ്ങളെ പോളിസി അപ്‌ഡേറ്റുകളായി മാറ്റുക – ഈ വാക്യങ്ങൾ പുതിയൊരു on-policy distillation ഘട്ടത്തിനുള്ള ലക്ഷ്യമായി മാറുന്നു, ഇത് തിരുത്തലിന് പിന്നിലെ യുക്തി മോഡലിനെ പഠിപ്പിക്കുന്നു.

നിർമ്മിക്കപ്പെട്ട പാഠങ്ങൾ ഇൻഫറൻസ് സമയത്ത് ഉപയോഗിക്കുന്ന പ്രോംപ്റ്റുകളല്ല; അവ പോളിസിയെ പുനർനിർമ്മിക്കുന്ന ആന്തരിക പരിശീലന സിഗ്നലുകളാണ്. ഫലത്തിൽ, ഏജന്റ് സ്വന്തം അധ്യാപകനായി മാറുകയും പരാജയങ്ങളുടെ ലോഗുകളെ ഘടനാപരമായ അറിവായി മാറ്റുകയും ചെയ്യുന്നു.

മെമ്മറി ട്രിക്കുകളേക്കാൾ ഈ രീതിയെ കാര്യക്ഷമമാക്കുന്നത് എന്താണ്

പിന്നീട് ഓർത്തെടുക്കുന്നതിനായി ശ്രദ്ധേയമായ അവസ്ഥകളോ കുറിപ്പുകളോ സംഭരിക്കുന്ന ഒരു എക്സ്റ്റേണൽ മെമ്മറി ബഫർ ഘടിപ്പിക്കുക എന്നത് ഒരു സാധാരണ പരിഹാരമാണ്. ആ തന്ത്രം ഒരു വലിയ "ഫയലിംഗ് ക്യാബിനറ്റ്" പോലെയാണ്, അവിടെ ഏജന്റ് ശരിയായ സമയത്ത് ശരിയായ ഭാഗം കണ്ടെത്താൻ പഠിക്കേണ്ടതുണ്ട്—ഇത് അധിക ജോലിഭാരം ഉണ്ടാക്കുന്നതും പ്രവർത്തനവും ഫലവും തമ്മിലുള്ള കാരണവും കണ്ടെത്താൻ പ്രയാസമുണ്ടാക്കുന്നതുമായ ഒരു പ്രശ്നമാണ്.

SEED ഈ പ്രശ്നത്തെ ഒഴിവാക്കുന്നു. ഡിസ്റ്റിലേഷൻ (distillation) വഴി പാഠങ്ങളെ നേരിട്ട് പോളിസിയിൽ ഉൾപ്പെടുത്തുന്നതിലൂടെ, ഏജന്റ് തിരുത്തലുകളെ പിന്നീട് നോക്കേണ്ട ഒരു കുറിപ്പായിട്ടല്ല, മറിച്ച് ഒരു നൈപുണ്യമായി ആന്തരികവൽക്കരിക്കുന്നു. ഇതിന്റെ ഫലമായി തെറ്റ് കണ്ടെത്തുന്നതിനും പെരുമാറ്റത്തിൽ മാറ്റം വരുത്തുന്നതിനും ഇടയിലുള്ള ബന്ധം കൂടുതൽ ശക്തമാകുന്നു.

പ്രധാനപ്പെട്ട കണക്കുകൾ

  • ALFWorld ബെഞ്ച്മാർക്ക് – ശരാശരി സ്കോർ 91.8, ഇതേ എൻവയോൺമെന്റ് ഉപയോഗിക്കുന്ന പരമ്പരാഗത RL ബേസ്‌ലൈനുകളെക്കാൾ മികച്ചത്.
  • ഡാറ്റാ കാര്യക്ഷമത – ഏകദേശം 40% കുറഞ്ഞ പരിശീലന എപ്പിസോഡുകൾ ഉപയോഗിച്ച് ഒരേതോ അതിനേക്കാളോ മികച്ച പ്രകടനം കൈവരിക്കുന്നു.
  • ജനറലൈസേഷൻ (Generalization) – കാണാത്ത ടാസ്ക്കുകളിൽ, ഈ രീതി സ്റ്റാൻഡേർഡ് RL-നേക്കാൾ 15.3 പോയിന്റുകൾ അധികം നൽകുന്നു, ഇത് സ്വയം നിർമ്മിച്ച പാഠങ്ങൾ കൈമാറ്റം ചെയ്യാവുന്ന യുക്തിപരമായ പാറ്റേണുകളെ ഉൾക്കൊള്ളുന്നു എന്ന് സൂചിപ്പിക്കുന്നു.

സങ്കീർണ്ണമായ ഏജന്റുകളെ പരിശീലിപ്പിക്കുന്നതിനുള്ള കമ്പ്യൂട്ടേഷണൽ, ഡാറ്റാ ബജറ്റ് കുറയ്ക്കാൻ SEED സഹായിക്കുമെന്ന് ഈ കണക്കുകൾ സൂചിപ്പിക്കുന്നു. ഇത് വലിയ സിമുലേഷൻ വിഭവങ്ങൾ ഇല്ലാത്ത ടീമുകൾക്ക് വലിയൊരു നേട്ടമാണ്.

അപകടസാധ്യതകളും പരിമിതികളും

മോഡലിന്റെ സ്വന്തം അനുഭവങ്ങളെ ശരിയായി വ്യാഖ്യാനിക്കാനുള്ള കഴിവിനെ ആശ്രയിച്ചാണ് ഈ സാങ്കേതികവിദ്യ നിലനിൽക്കുന്നത്. ഏജന്റ് പരിസ്ഥിതിയെ തെറ്റായി മനസ്സിലാക്കിയാൽ—ഉദാഹരണത്തിന്, ഒരു പരാജയത്തിന് തെറ്റായ കാരണം നൽകിയാൽ—അത് ആത്മവിശ്വാസത്തോടെ തെറ്റായ ഒരു പാഠം നിർമ്മിച്ചേക്കാം. അത്തരം തെറ്റായ നിർദ്ദേശങ്ങൾ (hallucinated advice) ഉപയോഗിച്ചുള്ള പരിശീലനം മോശം ശീലങ്ങൾ വർദ്ധിപ്പിച്ചേക്കാം. വിശകലന വിദഗ്ധർ ചിലപ്പോൾ ആഴത്തിലുള്ള പ്രശ്നങ്ങളെ മറച്ചുവെക്കുന്ന രീതിയിൽ അമിതമായി വൃത്തിയുള്ള വിശദീകരണങ്ങൾ തയ്യാറാക്കുന്ന മനുഷ്യരുടെ പോസ്റ്റ്-മോർട്ടം (post-mortems) വിശകലനങ്ങൾക്ക് സമാനമാണിതെന്ന് രചയിതാക്കൾ ചൂണ്ടിക്കാട്ടുന്നു.

അടുത്തതായി ശ്രദ്ധിക്കേണ്ടവ

  • നിലവിലുള്ള RL പൈപ്പ്‌ലൈനുകളുമായുള്ള സംയോജനം – SEED ഒരു എപ്പിസോഡിന് ശേഷമുള്ള പ്രോസസ്സിംഗ് ഘട്ടം മാത്രമാണ് ചേർക്കുന്നത് എന്നതിനാൽ, ചെറിയ എഞ്ചിനീയറിംഗ് പരിശ്രമത്തിലൂടെ നിലവിലുള്ള പല പരിശീലന ലൂപ്പുകളിലും ഇത് ഉൾപ്പെടുത്താൻ കഴിയും.

RL ഏജന്റുകൾ നിർമ്മിക്കുന്ന ഡെവലപ്പർമാർ എപ്പിസോഡ് ലോഗുകളെ വെറും ആർക്കൈവൽ ഡാറ്റയായി കാണാതിരിക്കാൻ ശ്രദ്ധിക്കണം. ഓരോ റണ്ണിന് ശേഷവും സിസ്റ്റത്തോട് താഴെ പറയുന്നവ കണ്ടെത്താൻ ആവശ്യപ്പെടുക:

  • ടാസ്ക് ഏറ്റവും കൂടുതൽ മുന്നോട്ട് കൊണ്ടുപോയ തീരുമാനം.
  • ഏറ്റവും കൂടുതൽ സമയം പാഴാക്കാൻ കാരണമായ അനുമാനം.
  • തെറ്റ് നേരത്തെ കണ്ടെത്താൻ സഹായിച്ചിരുന്ന ഒരു ലളിതമായ പരിശോധന.

ഈ കുറിപ്പുകൾ വെറും പ്രോംപ്റ്റുകളായി നൽകുന്നതിന് പകരം, SEED നിർദ്ദേശിക്കുന്നത് പോലെ ഒരു ഡിസ്റ്റിലേഷൻ ഘട്ടത്തിലേക്ക് നൽകുക. ഇതിന്റെ ഫലം വ്യക്തമാണ്: മികച്ച പ്രകടനം, കുറഞ്ഞ ഡാറ്റ, കൂടാതെ സ്വന്തം തെറ്റുകൾ വിശദീകരിക്കാൻ പഠിക്കുന്ന ഒരു മോഡൽ.

പ്രധാന പാഠം: പരാജയങ്ങളുടെ വിവരങ്ങളെ സ്വയം നിർമ്മിച്ച പാഠങ്ങളാക്കി മാറ്റുന്നതിലൂടെ, പരിമിതമായ പ്രതിഫലങ്ങൾ മാത്രം ലഭിക്കുന്ന ഫീഡ്‌ബാക്കിനെ സമൃദ്ധവും വീണ്ടും ഉപയോഗിക്കാൻ കഴിയുന്നതുമായ ഒരു പരിശീലന സിഗ്നലായി മാറ്റാൻ സാധിക്കും. ഇത് വേഗതയേറിയതും ഡാറ്റാ കാര്യക്ഷമതയുള്ളതുമായ RL-ലേക്ക് ഒരു പ്രായോഗിക പാത തുറന്നുനൽകുന്നു.