ഓരോ വിജയകരമായ പാതയും (trajectory) മോഡലിലേക്ക് നൽകുന്നതിനേക്കാൾ, കൃത്യമായി തിരഞ്ഞെടുത്ത 10% "pass" റണ്ണുകൾ ഉപയോഗിച്ച് പരിശീലിപ്പിക്കുന്നത് കൂടുതൽ കരുത്തുറ്റ AI ഏജന്റുകളെ സൃഷ്ടിക്കുമെന്ന് SWE-Prime കാണിച്ചുതരുന്നു. ഒരു "pass" ലേബലിനെ വിശ്വസനീയമായ ഒരു ഗുണനിലവാര ഫിൽട്ടറായി കാണുന്ന കാലങ്ങളായുള്ള ശീലത്തെ ഇത് ചോദ്യം ചെയ്യുന്നു.

കോഡ്-ജനറേഷൻ അല്ലെങ്കിൽ ഓട്ടോമേറ്റഡ് ഡിബഗ്ഗിംഗ് ഏജന്റുകൾ നിർമ്മിക്കുന്നവർക്ക് ഈ ഫലം വളരെ പ്രധാനപ്പെട്ടതാണ്: കൂടുതൽ ഡാറ്റ ലഭിക്കുന്നത് തനിയെ മികച്ച പ്രകടനം നൽകണമെന്നില്ല. പാസ്/ഫെയിൽ (pass/fail) എന്ന ലളിതമായ അടയാളത്തെ അമിതമായി ആശ്രയിക്കുന്നത്, യുക്തിപരമായ ചിന്തയ്ക്ക് (reasoning) പകരം അനാവശ്യമായ ടൂൾ കോളുകൾ ആവർത്തിക്കാനും, ലക്ഷ്യമില്ലാതെ അലയടിക്കാനും, ഭാഗ്യത്തെ മാത്രം ആശ്രയിക്കാനും മോഡലുകളെ പഠിപ്പിച്ചേക്കാം.

എന്തുകൊണ്ടാണ് "pass" ഫ്ലാഗിനെ വിശ്വസിച്ചിരുന്നത്

മിക്ക റൈൻഫോഴ്‌സ്‌മെന്റ് ലേണിംഗ് ഫ്രം ഹ്യൂമൻ ഫീഡ്‌ബാക്ക് (reinforcement-learning-from-human-feedback) പൈപ്പ്‌ലൈനുകളിലും, നിരീക്ഷണങ്ങൾ, പ്രവർത്തനങ്ങൾ, ടൂൾ ഉപയോഗങ്ങൾ എന്നിവയുടെ പൂർണ്ണമായ ഒരു ശ്രേണിയായ 'ട്രജക്റ്ററി' (trajectory) ടെസ്റ്റ് മാനദണ്ഡങ്ങൾ പാലിക്കുമ്പോൾ എഞ്ചിനീയർമാർ "pass" എന്ന് അടയാളപ്പെടുത്തുന്നു. ഇതിന് പിന്നിലെ അനുമാനം ലളിതമാണ്: ഏജന്റ് വിജയിച്ചുവെങ്കിൽ, ആ മുഴുവൻ എപ്പിസോഡിലും ഉപയോഗപ്രദമായ പെരുമാറ്റങ്ങൾ ഉണ്ടായിരിക്കണം. അതിനാൽ, വിജയത്തിലേക്ക് നയിച്ച പാറ്റേണുകൾ മോഡൽ ഉൾക്കൊള്ളുമെന്ന് പ്രതീക്ഷിച്ചുകൊണ്ട് അവർ എല്ലാ പാസ് റണ്ണുകളും ട്രെയിനിംഗ് പൂളിലേക്ക് ചേർക്കുന്നു.

മാസങ്ങളായി സോഫ്റ്റ്‌വെയർ എഞ്ചിനീയറിംഗ് (SWE) ഏജന്റുകൾക്കായുള്ള വൻതോതിലുള്ള ഡാറ്റാ ശേഖരണത്തിന് ഈ അനുമാനമാണ് വഴികാട്ടിയായിരുന്നത്. ഇതിന്റെ യുക്തി ശരിയാണെന്ന് തോന്നാം: ഒരു "pass" എന്നാൽ ഏജന്റ് പ്രശ്നം പരിഹരിച്ചു എന്നാണ് അർത്ഥം, അതിനാൽ ആ വിജയം കൈവരിക്കാൻ സഹായിച്ച രീതികളെ (policies) ആ എപ്പിസോഡ് കൂടുതൽ ശക്തമാക്കണം.

SWE-Prime വ്യത്യസ്തമായി ചെയ്തത്

SWE-Prime പഠനം ഈ രീതിയെ തിരുത്തിക്കുറിച്ചു. ഗവേഷകർ കോഡ് എഴുതുന്ന ജോലികളുടെ ഒരു സ്റ്റാൻഡേർഡ് ബെഞ്ച്മാർക്ക് എടുക്കുകയും വിജയകരമായ റണ്ണുകളെ രണ്ട് ഗ്രൂപ്പുകളായി തിരിക്കുകയും ചെയ്തു:

  1. എല്ലാ പാസ് ട്രജക്റ്ററികളും (All pass trajectories) – ടെസ്റ്റ് വിജയിച്ച എല്ലാ എപ്പിസോഡുകളും അടങ്ങിയ പരമ്പരാഗത ട്രെയിനിംഗ് സെറ്റ്.
  2. തിരഞ്ഞെടുത്ത 10% സബ്‌സെറ്റ് (A curated 10% subset) – മുഴുവൻ സെറ്റിൽ നിന്നും പ്രത്യേകം തിരഞ്ഞെടുക്കപ്പെട്ടവ.

രണ്ട് ഗ്രൂപ്പുകളും ഒരേ മോഡൽ ആർക്കിടെക്ചറുകൾ ഉപയോഗിച്ചാണ് ഫൈൻ ട്യൂൺ ചെയ്തത്. പുതിയ പ്രശ്നങ്ങളിൽ പരീക്ഷിച്ചപ്പോൾ, തിരഞ്ഞെടുത്ത 10% സബ്‌സെറ്റ് ഉപയോഗിച്ച് പരിശീലിപ്പിച്ച മോഡൽ, മുഴുവൻ പാസ് സെറ്റ് ഉപയോഗിച്ച് പരിശീലിപ്പിച്ച മോഡലിനേക്കാൾ മികച്ച പ്രകടനം കാഴ്ചവെച്ചു.

"pass" ലേബലിനെ തെറ്റായ രീതിയിൽ സ്വാധീനിക്കുന്ന പാറ്റേണുകൾ

ഒരു "pass" ഫ്ലാഗിന് പിന്നിൽ മറഞ്ഞിരിക്കുന്ന പല പരാജയ രീതികളും ഈ പഠനം കണ്ടെത്തി:

  • ആവർത്തിച്ചുള്ള ടൂൾ ഉപയോഗം (Repeated tool spamming) – ഒരു ഏജന്റ് ശരിയായ ഔട്ട്പുട്ട് ലഭിക്കുന്നതിന് മുമ്പ് ഒരേ കംപൈലറോ (compiler) ലിന്ററോ (linter) ഡസൻ കണക്കിന് തവണ ഉപയോഗിച്ചേക്കാം. അവസാന വിജയം ആ കാര്യക്ഷമതയില്ലായ്മയെ മറച്ചുവെക്കുന്നു.
  • അനാവശ്യമായ നീണ്ട ഘട്ടങ്ങൾ (Long meandering phases) – ശരിയായ പരിഹാരത്തിൽ എത്തുന്നതിന് മുമ്പ് ഏജന്റുകൾ ചിലപ്പോൾ അഞ്ച് അല്ലെങ്കിൽ അതിലധികം അപ്രസക്തമായ ഘട്ടങ്ങളിലൂടെ സഞ്ചരിക്കാറുണ്ട്. എപ്പിസോഡ് ഒരു "pass"-ൽ അവസാനിച്ചേക്കാം, എങ്കിലും ആ ട്രജക്റ്ററിയിൽ നിന്ന് പഠിക്കാൻ പ്രയോജനകരമായ കാര്യങ്ങൾ കുറവായിരിക്കും.
  • ലളിതമായ ടെസ്റ്റുകൾ (Trivial tests) – ചില ബെഞ്ച്മാർക്കുകൾ വളരെ എളുപ്പമുള്ളവയാണ്, അതിനാൽ ഒരു ഏകദേശ ഊഹം കൊണ്ടോ അല്ലെങ്കിൽ ഒരു വിടവ് (loophole) ഉപയോഗിച്ചോ ഏജന്റിന് വിജയിക്കാൻ സാധിക്കും. യഥാർത്ഥ യുക്തിയും (reasoning) ഭാഗ്യവും തമ്മിലുള്ള വ്യത്യാസം ഈ "pass" ലേബൽ തിരിച്ചറിയുന്നില്ല.

ഇത്തരം എപ്പിസോഡുകൾ വീണ്ടും ട്രെയിനിംഗ് ലൂപ്പിലേക്ക് വരുമ്പോൾ, ലക്ഷ്യമില്ലാത്ത അലച്ചിലും ടൂളുകളുടെ അമിത ഉപയോഗവും വിജയവുമായി ബന്ധിപ്പിക്കാൻ മോഡൽ പഠിക്കുന്നു. ഫലത്തിൽ, ഏജന്റ് "എന്തെങ്കിലും ശരിയാകുന്നത് വരെ ശ്രമിച്ചുകൊണ്ടേയിരിക്കുക" എന്നൊരു രീതി സ്വീകരിക്കുന്നു. കാര്യക്ഷമതയും വ്യക്തതയും (interpretability) ആവശ്യമുള്ള പ്രൊഡക്ഷൻ ഗ്രേഡ് സിസ്റ്റങ്ങൾക്ക് ഇത് ഒട്ടും അനുയോജ്യമല്ല.

സെഗ്‌മെന്റ് തലത്തിലുള്ള ഗുണനിലവാരവും ട്രജക്റ്ററി തലത്തിലുള്ള ഫലവും തമ്മിലുള്ള വ്യത്യാസം

ഒരു ട്രജക്റ്ററിയുടെ മൊത്തത്തിലുള്ള ഫലവും അതിലെ ഓരോ ഭാഗങ്ങളുടെയും (segments) ഗുണനിലവാരവും തമ്മിലുള്ള വ്യത്യാസമാണ് SWE-Prime നൽകുന്ന പ്രധാന പാഠം. ഒരു ട്രജക്റ്ററി എന്നത് ഒരു പൊതുവായ ലേബൽ മാത്രമാണ്: അവസാന ഉത്തരം ശരിയാണോ എന്ന് അത് പറയുന്നുണ്ടെങ്കിലും, അതിനുള്ളിലെ തീരുമാനമെടുക്കൽ പ്രക്രിയയെ അത് മറച്ചുവെക്കുന്നു. പഠനം നിരീക്ഷിച്ചത് ഇതാണ്:

  • നല്ല ട്രജക്റ്ററികളിൽ മോശം സെഗ്‌മെന്റുകൾ ഉണ്ടാകാം – കാര്യക്ഷമമായ ഒരു പരിഹാരത്തിൽ പോലും അവസാന ഉത്തരം ലഭിക്കാൻ സഹായിക്കാത്ത ചില അനാവശ്യ ഘട്ടങ്ങൾ ഉൾപ്പെട്ടിരിക്കാം.
  • പരാജയപ്പെട്ട ട്രജക്റ്ററികളിൽ മികച്ച സെഗ്‌മെന്റുകൾ ഉണ്ടാകാം – ഒരു ഏജന്റ് വളരെ കൃത്യമായ പ്ലാൻ തയ്യാറാക്കിയെങ്കിലും, അപ്രസക്തമായ ഒരു പിശക് കാരണം ടെസ്റ്റ് പരാജയപ്പെട്ടേക്കാം.

മുഴുവൻ റണ്ണുകൾക്ക് പകരം ഓരോ സെഗ്‌മെന്റുകൾക്കും സ്കോർ നൽകുന്നതിലൂടെ, ഏജന്റ് ആദ്യ പടി മുതൽ കൃത്യമായ ലക്ഷ്യത്തോടെ പ്രവർത്തിച്ച എപ്പിസോഡുകൾ മാത്രം ഗവേഷകർ നിലനിർത്തുകയും ബാക്കിയുള്ളവ ഒഴിവാക്കുകയും ചെയ്തു. ഇത് മോഡലുകൾ നമ്മൾ ആഗ്രഹിക്കുന്ന യുക്തിപരമായ പാറ്റേണുകൾ (reasoning patterns) പഠിക്കാൻ സഹായിക്കുന്നു.

ചിലവ്, വേഗത എന്നിവയിലെ നേട്ടങ്ങൾ

ഡാറ്റയുടെ പത്തിലൊന്ന് മാത്രം ഉപയോഗിച്ച് പരിശീലിപ്പിച്ചത് കമ്പ്യൂട്ടിംഗ് ചിലവ് ഗണ്യമായി കുറച്ചു. ടീമിന് വളരെ കുറഞ്ഞ GPU മണിക്കൂറുകൾ മാത്രമേ ആവശ്യമായി വന്നുള്ളൂ, കൂടാതെ മുഴുവൻ പാസ് സെറ്റിന് വേണ്ടിവന്ന സമയത്തിന്റെ ഒരു ചെറിയ ഭാഗത്തിനുള്ളിൽ തന്നെ പൈപ്പ്‌ലൈൻ പൂർത്തിയായി. ഇതിലെ വൈരുദ്ധ്യം ശ്രദ്ധേയമാണ്: കുറഞ്ഞ ചിലവിൽ കൂടുതൽ മികച്ച പ്രകടനം അവർ കൈവരിച്ചു. പരിമിതമായ ബജറ്റുള്ളതോ അല്ലെങ്കിൽ വലിയ തോതിൽ സിസ്റ്റങ്ങൾ വിന്യസിക്കാൻ ആഗ്രഹിക്കുന്നതോ ആയ സ്ഥാപനങ്ങൾക്ക് ഈ ലാഭം വളരെ വലുതാണ്.

ക്യൂറേഷൻ വെല്ലുവിളി

ഈ രീതി നടപ്പിലാക്കുന്നതിലെ ഏറ്റവും വലിയ തടസ്സം എന്താണ് ഒരു "നല്ല സെഗ്‌മെന്റ്" എന്ന് നിർവചിക്കുക എന്നതാണ്. വലിയ ചിലവുള്ള ഒരു റിവാർഡ് മോഡൽ (reward model) ഇല്ലാതെ സെഗ്‌മെന്റുകൾക്ക് സ്കോർ നൽകുന്നത് പ്രയാസകരമാണെന്നും അതിന് ബുദ്ധിപരമായ ഒരു ലഘു അളവുകോൽ (lightweight metric) ആവശ്യമാണെന്നും SWE-Prime ടീം ചൂണ്ടിക്കാട്ടി.

സംഗ്രഹം (Takeaway)

SWE-Prime തെളിയിക്കുന്നത് ട്രെയിനിംഗ് ഡാറ്റയ്ക്കായി ഒരു ബൈനറി “passed the test” ഫ്ലാഗ് ഉപയോഗിക്കുന്നത് വിശ്വസനീയമല്ലാത്ത ഒരു രീതിയാണെന്നാണ്. ലക്ഷ്യമില്ലാതെ നീളുന്ന എപ്പിസോഡുകൾ, ആവർത്തന സ്വഭാവമുള്ള ടൂൾ കോളുകൾ, വളരെ എളുപ്പമുള്ള റണ്ണുകൾ എന്നിവ ഒഴിവാക്കുന്നതിലൂടെ, കമ്പ്യൂട്ട് ചിലവുകൾ കുറയ്ക്കുന്നതോടൊപ്പം കൂടുതൽ പ്രാപ്തിയുള്ളതും കാര്യക്ഷമതയുള്ളതുമായ ഏജന്റുകളെ പരിശീലിപ്പിക്കാൻ ഡെവലപ്പർമാർക്ക് സാധിക്കും. പാഠം വ്യക്തമാണ്: അളവിനേക്കാൾ ഗുണമേന്മയ്ക്കാണ് പ്രാധാന്യം, ഓരോ ഘട്ടവും യഥാർത്ഥത്തിൽ എന്ത് സംഭാവന നൽകുന്നു എന്നതിനെക്കുറിച്ചുള്ള സൂക്ഷ്മമായ വിലയിരുത്തലിലൂടെയാണ് കൂടുതൽ ബുദ്ധിപരമായ AI ഏജന്റുകളിലേക്കുള്ള പാത തുറക്കുന്നത്.