SWE-bench સ્કોર્સ બે વર્ષથી ઓછા સમયમાં 1.96% થી વધીને 72.7% થઈ ગયા છે, એવો વધારો જેને હેડલાઇન્સમાં AI કોડિંગ ક્ષમતામાં 37 ગણો ઉછાળો તરીકે દર્શાવવામાં આવ્યો છે. હેડલાઇન ધ્યાન ખેંચે છે, પરંતુ આ આંકડાઓ બે અલગ-અલગ પરીક્ષાઓની તુલના કરે છે, સોફ્ટવેર-એન્જિનિયરિંગ કૌશલ્યમાં કોઈ એક સમાન અથવા સતત સુધારો નથી.
કાચા આંકડા
2023 માં, મૂળ SWE-bench એ 2,294 વાસ્તવિક GitHub ઇશ્યુઝ (issues) પર AI એજન્ટ્સનું મૂલ્યાંકન કર્યું હતું. આ કાર્યો એક અસ્તવ્યસ્ત મિશ્રણ હતા: અસ્પષ્ટ વર્ણનો, તૂટેલા ટેસ્ટ અને એવી ઘણી સમસ્યાઓ જે ઉકેલવામાં માણસને પણ મુશ્કેલી પડે. 2025 સુધીમાં, એ જ બેન્ચમાર્ક નામ 72.7% સ્કોર સાથે જોવા મળ્યું, પરંતુ પરીક્ષણને માત્ર 500 કાર્યોના "Verified" સબસેટ (subset) સુધી મર્યાદિત કરવામાં આવ્યું હતું, જેને સ્પષ્ટતા અને ઉકેલી શકાય તેવા હોવા માટે માણસો દ્વારા તપાસવામાં આવ્યા હતા.
પરીક્ષા કેવી રીતે બદલાઈ
સંપૂર્ણ કેટલોગમાંથી Verified સેટ તરફનું પરિવર્તન એ પ્રથમ અને સૌથી દેખીતું પરિવર્તન છે. મૂળ સંગ્રહ ઓપન-સોર્સ યોગદાનની અસ્તવ્યસ્ત વાસ્તવિકતાને પ્રતિબિંબિત કરવાનો પ્રયાસ કરતો હતો—જેવા કે અધૂરા ઇશ્યુઝ, નબળા દસ્તાવેજો (documentation), અથવા વધારાના સંદર્ભ વિના ઉકેલવા અશક્ય હોય તેવા પ્રશ્નો. તેનાથી વિપરીત, Verified વર્ઝન જાણીજોઈને તે અસ્તવ્યસ્તતાને ફિલ્ટર કરે છે. તે વધુ સ્વચ્છ અને સરળ સમસ્યાઓનો સેટ રજૂ કરે છે જ્યાં ઊંચા સ્કોર મેળવવા વાસ્તવિક રીતે શક્ય છે.
કારણ કે આ બંને વર્ઝન સમસ્યાના ક્ષેત્રના અલગ-અલગ ભાગોને માપે છે, તેથી સીધી ટકાવારીની તુલના ગેરમાર્ગે દોરે છે. 1.96% નો આંકડો કાચા અને અનફિલ્ટર કરેલા કામ પરના પ્રદર્શનને દર્શાવે છે; જ્યારે 72.7% નો આંકડો પસંદ કરેલા (curated) નમૂના પરના પ્રદર્શનને દર્શાવે છે જ્યાં સફળતાની શક્યતા ઘણી વધારે છે.
લક્ષિત એન્જિનિયરિંગ
ડેવલપર્સ બેન્ચમાર્ક પ્રત્યે કેવી રીતે અભિગમ રાખે છે તેમાં બીજું અને વધુ સૂક્ષ્મ પરિવર્તન આવ્યું. 2023 માં, કોઈએ ખાસ કરીને SWE-bench માં શ્રેષ્ઠ પ્રદર્શન કરવા માટે એજન્ટ્સ બનાવ્યા નહોતા; આ પરીક્ષા વિશ્વના કોડિંગ પડકારોના એક રેન્ડમ સેમ્પલ તરીકે કામ કરતી હતી. 2025 સુધીમાં, ટીમોએ બેન્ચમાર્કને સ્કોરબોર્ડમાં ફેરવી દીધું. તેઓએ Verified સેટ પર સારો સ્કોર મેળવવાના સ્પષ્ટ ઉદ્દેશ્ય સાથે સ્કેફોલ્ડિંગ (scaffolding), પ્રોમ્પ્ટિંગ વ્યૂહરચનાઓ અને ફાઇન-ટ્યુન કરેલા મોડલ્સ બનાવ્યા.
જ્યારે એન્જિનિયરો કોઈ ચોક્કસ પરીક્ષા પાસ કરવા માટે સિસ્ટમ ડિઝાઇન કરે છે, ત્યારે સ્કોર એ દર્શાવે છે કે સિસ્ટમ તે પરીક્ષામાં કેટલી સારી રીતે બંધ બેસે છે, નહીં કે તે કેટલી વ્યાપક રીતે સક્ષમ છે. જે ક્ષણે બેન્ચમાર્કને "સુધારવામાં" (repaired) આવ્યું અને તેને લક્ષ્યમાં ફેરવવામાં આવ્યું, તે ક્ષણે તે વાસ્તવિક દુનિયાના કામના પ્રતિનિધિત્વ કરતા નમૂના તરીકે રહેવાનું બંધ કરી દીધું.
આ ઉછાળાનો ખરો અર્થ શું છે
હેડલાઇન્સમાં દેખાતો સુધારો એ અર્થમાં સાચો છે કે વર્તમાન કોડિંગ એજન્ટ્સ મૂળ સેટ કરતા Verified કાર્યો પર ઘણો સારો દેખાવ કરે છે. તે સ્પર્ધાઓ, સંશોધન પત્રો અને પ્રોડક્ટ ડેમો માટે મહત્વપૂર્ણ છે જે આ જ પસંદ કરેલા (curated) બેન્ચમાર્ક પર આધારિત છે.
જોકે, આ ઉછાળો એ સાબિત કરતો નથી કે AI એજન્ટ્સ હવે રોજિંદા સોફ્ટવેર ડેવલપમેન્ટની અસ્તવ્યસ્તતાને સંભાળી શકે છે. મૂળ 2,294-ઇશ્યુનો સેટ હજુ પણ અસ્તિત્વમાં છે, અને તે વર્ઝન પરના સ્કોર હજુ પણ નીચા છે.
પૂછવા જેવા પ્રશ્નો
જ્યારે પણ તમે બેન્ચમાર્ક પરિણામોમાં મોટો ફેરફાર જુઓ, ત્યારે આ ત્રણ બાબતો ધ્યાનમાં રાખો:
- કયા વર્ઝન વિશે રિપોર્ટ કરવામાં આવી રહ્યો છે? Original, Lite, કે Verified? સમાન નામો ખૂબ જ અલગ કાર્યોના સંગ્રહને છુપાવી શકે છે.
- શું ફિલ્ટર કરવામાં આવ્યું હતું? અસ્પષ્ટ અથવા અશક્ય કાર્યોને દૂર કરવાથી કોઈપણ સિસ્ટમની ક્ષમતા વધી જાય છે; પરંતુ તે એવા પડકારોને પણ દૂર કરે છે જે પ્રોડક્શનમાં મહત્વના હોય છે.
- શું સિસ્ટમ આ ચોક્કસ પરીક્ષા પાસ કરવા માટે બનાવવામાં આવી હતી? જો ડેવલપર્સે બેન્ચમાર્ક માટે મોડલ્સ અથવા પાઇપલાઇન્સને ટ્યુન કર્યા હોય, તો સ્કોર એ ઓપ્ટિમાઇઝેશન (optimization) માપે છે, કાચી ક્ષમતા (raw capability) નહીં.
ભવિષ્ય તરફ જોતા
જ્યાં સુધી આવા સુરક્ષાત્મક પગલાં પ્રમાણભૂત ન બને ત્યાં સુધી, AI કોડરની ઉપયોગિતાનું શ્રેષ્ઠ માપદંડ ડેવલપર્સ દ્વારા દરરોજ સામનો કરવામાં આવતા અસ્તવ્યસ્ત, વાસ્તવિક દુનિયાના ઇશ્યુઝ પર તેનું પ્રદર્શન જ રહેશે.
મુખ્ય વાત (Takeaway): સુધારેલા અને લક્ષિત બેન્ચમાર્ક પર ઊંચો સ્કોર એ આપમેળે સાબિત નથી કરતો કે AI એજન્ટ્સ વાસ્તવિક દુનિયાના કોડની અસ્તવ્યસ્તતા માટે તૈયાર છે; સાચી કસોટી એ અનફિલ્ટર કરેલી સમસ્યાઓ છે જેનો એન્જિનિયરોએ દરરોજ સામનો કરવો પડે છે.
