SWE-bench స్కోర్లు రెండు సంవత్సరాల కంటే తక్కువ కాలంలోనే 1.96% నుండి 72.7%కి పెరిగాయి, ఈ పెరుగుదలను AI కోడింగ్ సామర్థ్యంలో 37 రెట్ల వృద్ధిగా వార్తా శీర్షికలు చిత్రీకరిస్తున్నాయి. ఆ శీర్షికలు దృష్టిని ఆకర్షిస్తాయి కానీ, ఆ సంఖ్యలు సాఫ్ట్‌వేర్ ఇంజనీరింగ్ నైపుణ్యంలో ఒకే విధమైన స్థిరమైన మెరుగుదలని కాకుండా, రెండు వేర్వేరు పరీక్షలను పోల్చుతున్నాయి.

అసలు గణాంకాలు

2023లో అసలు SWE-bench 2,294 నిజమైన GitHub ఇష్యూలపై AI ఏజెంట్లను అంచనా వేసింది. ఆ టాస్క్‌లు చాలా గందరగోళంగా ఉన్నాయి: అస్పష్టమైన వివరణలు, పాడైపోయిన టెస్ట్‌లు మరియు మనుషులు కూడా పరిష్కరించడానికి ఇబ్బంది పడే అనేక సమస్యలు అందులో ఉన్నాయి. 2025 నాటికి అదే బెంచ్‌మార్క్ పేరు 72.7% స్కోర్‌తో కనిపించింది, కానీ ఆ పరీక్షను మనుషులు స్పష్టత మరియు పరిష్కరించదగిన సామర్థ్యం కోసం పరిశీలించిన కేవలం 500 టాస్క్‌ల "Verified" సబ్‌సెట్‌కు పరిమితం చేశారు.

పరీక్ష ఎలా మారింది

పూర్తి క్యాటలాగ్ నుండి Verified సెట్‌కు మారడం అనేది మొదటి మరియు అత్యంత స్పష్టమైన మార్పు. అసలు సేకరణ ఓపెన్-సోర్స్ సహకారాల యొక్క గందరగోళ వాస్తవికతను ప్రతిబింబించడానికి ప్రయత్నించింది—అంటే అసంపూర్తిగా ఉన్నవి, సరిగ్గా డాక్యుమెంట్ చేయబడనివి లేదా అదనపు సందర్భం లేకుండా పరిష్కరించడం అసాధ్యమైన ఇష్యూలు. దీనికి విరుద్ధంగా, Verified వెర్షన్ కావాలనే ఆ గందరగోళాన్ని వడపోస్తుంది. ఇది మరింత స్పష్టమైన, సులభంగా పరిష్కరించదగిన సమస్యల సమితిని అందిస్తుంది, ఇక్కడ అధిక స్కోర్‌లను సాధించడం వాస్తవికంగా సాధ్యమవుతుంది.

ఈ రెండు వెర్షన్లు సమస్య యొక్క వేర్వేరు భాగాలను కొలుస్తాయి కాబట్టి, నేరుగా శాతంతో పోల్చడం తప్పుదారి పట్టిస్తుంది. 1.96% అనేది ముడి, వడపోత లేని పనులపై పనితీరును సూచిస్తుంది; 72.7% అనేది విజయ అవకాశాలు చాలా ఎక్కువగా ఉండే ఎంపిక చేసిన నమూనాపై పనితీరును సూచిస్తుంది.

లక్షిత ఇంజనీరింగ్

రెండవది, మరింత సూక్ష్మమైన మార్పు డెవలపర్లు బెంచ్‌మార్క్‌ను ఎలా సమీపించారనే దానిలో జరిగింది. 2023లో, ఎవరూ SWE-benchలో రాణించడం కోసం ప్రత్యేకంగా ఏజెంట్లను నిర్మించలేదు; ఆ పరీక్ష ప్రపంచంలోని కోడింగ్ సవాళ్ల యొక్క యాదృచ్ఛిక నమూనాగా (random sample) పనిచేసింది. 2025 నాటికి, బృందాలు ఈ బెంచ్‌మార్క్‌ను ఒక స్కోర్‌బోర్డ్‌గా మార్చేశాయి. వారు Verified సెట్‌లో మంచి స్కోరు సాధించాలనే స్పష్టమైన లక్ష్యంతో scaffolding, prompting వ్యూహాలు మరియు fine-tuned మోడళ్లను రూపొందించారు.

ఇంజనీర్లు ఒక నిర్దిష్ట పరీక్షను పాస్ చేయడానికి ఒక వ్యవస్థను రూపొందించినప్పుడు, ఆ స్కోరు ఆ వ్యవస్థ ఎంత విస్తృతంగా సమర్థవంతమైనదో కాకుండా, ఆ పరీక్షకు అది ఎంత బాగా సరిపోతుందో మాత్రమే తెలియజేస్తుంది. బెంచ్‌మార్క్ "రిపేర్" చేయబడి ఒక లక్ష్యంగా మారిన క్షణమే, అది నిజ ప్రపంచ పనికి ప్రతినిధిగా ఉండటం ఆగిపోయింది.

ఈ పెరుగుదల నిజంగా దేనిని సూచిస్తుంది

ప్రస్తుత కోడింగ్ ఏజెంట్లు అసలు సెట్ కంటే Verified టాస్క్‌లపై అద్భుతంగా పనితీరు కనబరుస్తున్నాయనే అర్థంలో, వార్తల్లో నిలిచిన ఈ మెరుగుదల నిజమే. అదే ఎంపిక చేసిన బెంచ్‌మార్క్‌పై ఆధారపడే పోటీలు, పరిశోధనా పత్రాలు మరియు ప్రొడక్ట్ డెమోలకు ఈ మెరుగుదల ముఖ్యం.

అయితే, ఈ పెరుగుదల AI ఏజెంట్లు ఇప్పుడు రోజువారీ సాఫ్ట్‌వేర్ డెవలప్‌మెంట్ యొక్క గందరగోళాన్ని ఎదుర్కోగలవని నిరూపించదు. అసలు 2,294 ఇష్యూల సెట్ ఇంకా ఉంది, మరియు ఆ వెర్షన్‌పై స్కోర్‌లు తక్కువగానే ఉన్నాయి.

అడగవలసిన ప్రశ్నలు

బెంచ్‌మార్క్ ఫలితాలలో భారీ మార్పును మీరు చూసినప్పుడల్లా, ఈ మూడు అంశాలను గుర్తుంచుకోండి:

  • ఏ వెర్షన్ గురించి నివేదించబడింది? Original, Lite, లేదా Verified? ఒకే పేరు ఉన్నప్పటికీ, అవి చాలా భిన్నమైన టాస్క్ పూల్‌లను కలిగి ఉండవచ్చు.
  • ఏమి వడపోత చేయబడింది? గందరగోళంగా ఉన్న లేదా అసాధ్యమైన టాస్క్‌లను తొలగించడం వల్ల ఏ వ్యవస్థకైనా స్కోరు పెరిగే అవకాశం ఉంటుంది; కానీ ఇది productionలో నిజంగా అవసరమయ్యే సవాళ్లను కూడా తొలగిస్తుంది.
  • ఈ నిర్దిష్ట పరీక్షను పాస్ చేయడానికి మాత్రమే వ్యవస్థను నిర్మించారా? డెవలపర్లు బెంచ్‌మార్క్ కోసం మోడళ్లను లేదా పైప్‌లైన్‌లను ట్యూన్ చేసినట్లయితే, ఆ స్కోరు కేవలం optimizationను మాత్రమే కొలుస్తుంది, ముడి సామర్థ్యాన్ని కాదు.

భవిష్యత్తు వైపు చూస్తే

ఇటువంటి రక్షణ చర్యలు ప్రామాణికంగా మారే వరకు, ఒక AI కోడర్ యొక్క ఉపయోగకరతను అంచనా వేయడానికి ఉత్తమమైన కొలమానం డెవలపర్లు ప్రతిరోజూ ఎదుర్కొనే గందరగోళమైన, నిజ ప్రపంచ ఇష్యూలపై దాని పనితీరు మాత్రమే అవుతుంది.

ముఖ్య గమనిక: రిపేర్ చేయబడిన, లక్షిత బెంచ్‌మార్క్‌పై అధిక స్కోరు సాధించినంత మాత్రాన AI ఏజెంట్లు నిజ ప్రపంచ కోడ్ గందరగోళానికి సిద్ధంగా ఉన్నాయని నిరూపితం కాదు; ఇంజనీర్లు ప్రతిరోజూ పోరాడే వడపోత లేని సమస్యలే అసలైన పరీక్ష.