രണ്ട് വർഷത്തിൽ താഴെ സമയം കൊണ്ട് SWE-bench സ്കോറുകൾ 1.96%-ൽ നിന്ന് 72.7%-ലേക്ക് കുതിച്ചുയർന്നു. AI കോഡിംഗ് ശേഷിയിൽ 37 മടങ്ങ് വർദ്ധനവ് ഉണ്ടായെന്ന രീതിയിലാണ് വാർത്തകൾ ഇതിനെ അവതരിപ്പിക്കുന്നത്. ഈ തലക്കെട്ടുകൾ ശ്രദ്ധ ആകർഷിക്കുമെങ്കിലും, ഈ കണക്കുകൾ താരതമ്യം ചെയ്യുന്നത് രണ്ട് വ്യത്യസ്ത പരീക്ഷകളെയാണ്, അല്ലാതെ സോഫ്റ്റ്വെയർ എൻജിനീയറിംഗ് നൈപുണ്യത്തിലെ ഒരേപോലെയുള്ള പുരോഗതിയെ അല്ല.
യഥാർത്ഥ കണക്കുകൾ
2023-ൽ യഥാർത്ഥ SWE-bench, 2,294 യഥാർത്ഥ GitHub ഇഷ്യൂസിലൂടെയാണ് AI ഏജന്റുകളെ വിലയിരുത്തിയത്. അവ സങ്കീർണ്ണമായ ജോലികളായിരുന്നു: അവ്യക്തമായ വിവരണങ്ങൾ, തകരാറിലായ ടെസ്റ്റുകൾ, മനുഷ്യർക്ക് പോലും പരിഹരിക്കാൻ പ്രയാസമുള്ള നിരവധി പ്രശ്നങ്ങൾ എന്നിവ ഇതിൽ ഉൾപ്പെട്ടിരുന്നു. എന്നാൽ 2025 ആയപ്പോഴേക്കും അതേ ബെഞ്ച്മാർക്ക് പേരിൽ തന്നെ 72.7% സ്കോർ കാണിച്ചുവെങ്കിലും, പരീക്ഷാ രീതിയിൽ മാറ്റം വന്നിരുന്നു. വ്യക്തതയ്ക്കും പരിഹരിക്കാൻ കഴിയുന്നതിനും മനുഷ്യർ പരിശോധിച്ച വെറും 500 ജോലികൾ മാത്രമുള്ള ഒരു “Verified” സബ്സെറ്റിലേക്ക് പരീക്ഷ ചുരുക്കപ്പെട്ടിരുന്നു.
പരീക്ഷ എങ്ങനെ മാറി
മുഴുവൻ കാറ്റലോഗിൽ നിന്നും 'Verified' സെറ്റിലേക്കുള്ള മാറ്റമാണ് ഏറ്റവും പ്രകടമായ ആദ്യ മാറ്റം. ഓപ്പൺ സോഴ്സ് സംഭാവനകളിലെ യഥാർത്ഥ സങ്കീർണ്ണതകളെ പ്രതിഫലിപ്പിക്കാനാണ് യഥാർത്ഥ ശേഖരം ശ്രമിച്ചത്—അപൂർണ്ണമായതോ, കൃത്യമായ രേഖകളില്ലാത്തതോ, അല്ലെങ്കിൽ കൂടുതൽ വിവരങ്ങൾ ഇല്ലാതെ പരിഹരിക്കാൻ കഴിയാത്തതോ ആയ പ്രശ്നങ്ങൾ അതിലുണ്ടായിരുന്നു. എന്നാൽ ഇതിന് വിപരീതമായി, 'Verified' പതിപ്പ് ആ സങ്കീർണ്ണതകളെ ബോധപൂർവ്വം ഒഴിവാക്കുന്നു. ഉയർന്ന സ്കോറുകൾ എളുപ്പത്തിൽ നേടാൻ കഴിയുന്ന തരത്തിലുള്ള കൂടുതൽ വ്യക്തവും പരിഹരിക്കാൻ എളുപ്പമുള്ളതുമായ പ്രശ്നങ്ങളാണ് ഇതിൽ അവതരിപ്പിക്കുന്നത്.
രണ്ട് പതിപ്പുകളും പ്രശ്നപരിധിയുടെ (problem space) വ്യത്യസ്ത ഭാഗങ്ങളെയാണ് അളക്കുന്നത് എന്നതിനാൽ, നേരിട്ടുള്ള ശതമാന താരതമ്യം തെറ്റിദ്ധരിപ്പിക്കുന്നതാണ്. 1.96% എന്ന കണക്ക് അസംസ്കൃതവും (unfiltered) നേരിട്ടുള്ളതുമായ ജോലികളിലെ പ്രകടനത്തെ സൂചിപ്പിക്കുന്നു; എന്നാൽ 72.7% എന്നത് വിജയസാധ്യത വളരെ കൂടുതലായ, തിരഞ്ഞെടുത്ത ഒരു സാമ്പിളിലെ പ്രകടനത്തെയാണ് സൂചിപ്പിക്കുന്നത്.
ലക്ഷ്യമിട്ടുള്ള എൻജിനീയറിങ്
ഡെവലപ്പർമാർ ബെഞ്ച്മാർക്കിനെ സമീപിക്കുന്ന രീതിയിൽ രണ്ടാമതൊരു സൂക്ഷ്മമായ മാറ്റവും ഉണ്ടായിട്ടുണ്ട്. 2023-ൽ, SWE-bench മികച്ച രീതിയിൽ പാസാകാൻ വേണ്ടി മാത്രം ആരും ഏജന്റുകളെ നിർമ്മിച്ചിരുന്നില്ല; ലോകത്തിലെ കോഡിംഗ് വെല്ലുവിളികളുടെ ഒരു സാമ്പിൾ മാത്രമായിരുന്നു ആ പരീക്ഷ. എന്നാൽ 2025 ആയപ്പോഴേക്കും, ടീമുകൾ ഈ ബെഞ്ച്മാർക്കിനെ ഒരു സ്കോർബോർഡായി മാറ്റി. 'Verified' സെറ്റിൽ ഉയർന്ന സ്കോർ നേടുന്നതിനായി അവർ പ്രത്യേകമായ scaffolding, prompting strategies, കൂടാതെ fine-tuned models എന്നിവ നിർമ്മിച്ചു.
ഒരു പ്രത്യേക പരീക്ഷ പാസാകാൻ വേണ്ടി മാത്രം എൻജിനീയർമാർ ഒരു സിസ്റ്റം രൂപകൽപ്പന ചെയ്യുമ്പോൾ, ആ സ്കോർ ആ സിസ്റ്റം എത്രത്തോളം കഴിവുള്ളതാണ് എന്നതിനെക്കാൾ, ആ പരീക്ഷയ്ക്ക് അത് എത്രത്തോളം അനുയോജ്യമാണ് എന്നതിനെയാണ് കാണിക്കുന്നത്. ബെഞ്ച്മാർക്ക് ഒരു ലക്ഷ്യമായി (target) മാറിയതോടെ, അത് യഥാർത്ഥ ലോകത്തെ ജോലികളുടെ പ്രതിനിധിയായ ഒരു സാമ്പിൾ എന്ന നിലയിൽ നിന്നും മാറി.
ഈ കുതിച്ചുചാട്ടം യഥാർത്ഥത്തിൽ എന്താണ് അർത്ഥമാക്കുന്നത്?
നിലവിലെ കോഡിംഗ് ഏജന്റുകൾ യഥാർത്ഥ സെറ്റിനേക്കാൾ 'Verified' ജോലികളിൽ വളരെ മികച്ച രീതിയിൽ പ്രവർത്തിക്കുന്നു എന്നതുകൊണ്ട് ഈ പുരോഗതി യഥാർത്ഥമാണ്. ഒരേ ബെഞ്ച്മാർക്ക് ഉപയോഗിക്കുന്ന മത്സരങ്ങൾക്കും ഗവേഷണ പ്രബന്ധങ്ങൾക്കും ഉൽപ്പന്ന ഡെമോകൾക്കും ഈ പുരോഗതി പ്രസക്തമാണ്.
എന്നിരുന്നാലും, ദൈനംദിന സോഫ്റ്റ്വെയർ വികസനത്തിലെ സങ്കീർണ്ണതകൾ കൈകാര്യം ചെയ്യാൻ AI ഏജന്റുകൾക്ക് ഇപ്പോൾ സാധിക്കുമെന്ന് ഈ കുതിച്ചുചാട്ടം തെളിയിക്കുന്നില്ല. യഥാർത്ഥ 2,294 ഇഷ്യൂകൾ അടങ്ങിയ സെറ്റ് ഇപ്പോഴും നിലവിലുണ്ട്, ആ പതിപ്പിലെ സ്കോറുകൾ ഇപ്പോഴും കുറവാണ്.
ചോദിക്കേണ്ട ചോദ്യങ്ങൾ
ബെഞ്ച്മാർക്ക് ഫലങ്ങളിൽ വലിയ മാറ്റങ്ങൾ കാണുമ്പോൾ, ഈ മൂന്ന് കാര്യങ്ങൾ എപ്പോഴും ഓർമ്മിക്കുക:
- ഏത് പതിപ്പാണ് റിപ്പോർട്ട് ചെയ്യുന്നത്? Original, Lite, അതോ Verified ആണോ? ഒരേ പേരുള്ളവയാണെങ്കിലും അവ തികച്ചും വ്യത്യസ്തമായ ജോലികൾ ആകാം.
- എന്തൊക്കെയാണ് ഒഴിവാക്കിയത്? സങ്കീർണ്ണമോ പരിഹരിക്കാൻ കഴിയാത്തതോ ആയ ജോലികൾ ഒഴിവാക്കുന്നത് ഏതൊരു സിസ്റ്റത്തിന്റെയും സ്കോർ വർദ്ധിപ്പിക്കും; എന്നാൽ ഇത് യഥാർത്ഥ പ്രൊഡക്ഷനിൽ നേരിടേണ്ടി വരുന്ന വെല്ലുവിളികളെ തന്നെ ഇല്ലാതാക്കുന്നു.
- ഈ പ്രത്യേക പരീക്ഷ പാസാകാൻ വേണ്ടിയാണോ സിസ്റ്റം നിർമ്മിച്ചത്? ഡെവലപ്പർമാർ ബെഞ്ച്മാർക്കിന് വേണ്ടി മോഡലുകളോ പൈപ്പ്ലൈനുകളോ ട്യൂൺ ചെയ്തതാണെങ്കിൽ, ആ സ്കോർ അളക്കുന്നത് ഒപ്റ്റിമൈസേഷനെയാണ് (optimization), അല്ലാതെ യഥാർത്ഥ കഴിവിനെയല്ല.
ഭാവിയിലേക്ക്
ഇത്തരം സുരക്ഷാ മാനദണ്ഡങ്ങൾ നിലവിലുള്ളതാകുന്നത് വരെ, ഒരു AI കോഡറുടെ ഉപയോഗക്ഷമത അളക്കാനുള്ള ഏറ്റവും നല്ല മാർഗ്ഗം ഡെവലപ്പർമാർ ദിവസവും നേരിടുന്ന യഥാർത്ഥ ലോകത്തെ സങ്കീർണ്ണമായ പ്രശ്നങ്ങളിലെ അതിന്റെ പ്രകടനമായിരിക്കും.
ചുരുക്കത്തിൽ: പരിഷ്കരിക്കപ്പെട്ടതും ലക്ഷ്യമിട്ടുള്ളതുമായ ഒരു ബെഞ്ച്മാർക്കിലെ ഉയർന്ന സ്കോർ, AI ഏജന്റുകൾ യഥാർത്ഥ ലോകത്തെ കോഡിംഗിലെ സങ്കീർണ്ണതകൾ കൈകാര്യം ചെയ്യാൻ തയ്യാറാണെന്ന് അർത്ഥമാക്കുന്നില്ല; എൻജിനീയർമാർ ദിവസവും നേരിടുന്ന അസംസ്കൃത പ്രശ്നങ്ങളാണ് യഥാർത്ഥ പരീക്ഷ.
