SWE-bench மதிப்பெண்கள் இரண்டு ஆண்டுகளுக்கும் குறைவான காலத்தில் 1.96% இலிருந்து 72.7% ஆக உயர்ந்தன, இந்த உயர்வு AI குறியீட்டுத் திறனில் (coding ability) 37 மடங்கு முன்னேற்றம் என்று செய்திகளில் சித்தரிக்கப்பட்டுள்ளது. அந்தச் செய்தி கவனத்தை ஈர்க்கலாம், ஆனால் இந்த எண்கள் இரண்டு வெவ்வேறு தேர்வுகளை ஒப்பிடுகின்றன; இது மென்பொருள் பொறியியல் திறனில் ஏற்பட்ட ஒரே சீரான முன்னேற்றம் அல்ல.
உண்மையான எண்கள்
2023-இல், அசல் SWE-bench 2,294 உண்மையான GitHub சிக்கல்களைக் கொண்டு AI ஏஜென்ட்களை (agents) மதிப்பீடு செய்தது. அந்தப் பணிகள் ஒரு குழப்பமான கலவையாக இருந்தன: தெளிவற்ற விளக்கங்கள், முறிந்த சோதனைகள் (broken tests) மற்றும் ஒரு மனிதனே தீர்க்க சிரமப்படும் பல சிக்கல்கள் அதில் இருந்தன. 2025-இல் அதே பெஞ்ச்மார்க் பெயர் 72.7% மதிப்பெண்ணுடன் தோன்றியது, ஆனால் அந்தத் தேர்வு, மனிதர்களால் தெளிவு மற்றும் தீர்க்கும் திறன் ஆகியவற்றிற்காக சரிபார்க்கப்பட்ட வெறும் 500 பணிகளைக் கொண்ட “Verified” என்ற ஒரு சிறிய தொகுப்பிற்குள் சுருக்கப்பட்டிருந்தது.
தேர்வு எவ்வாறு மாறியது
முழுமையான தொகுப்பிலிருந்து “Verified” தொகுப்பிற்கு மாறியதுதான் முதல் மற்றும் மிகத் தெளிவான மாற்றமாகும். அசல் தொகுப்பு, திறந்த மூலப் பங்களிப்புகளின் (open-source contributions) குழப்பமான யதார்த்தத்தைப் பிரதிபலிக்க முயன்றது—அதாவது முழுமையற்றவை, மோசமான ஆவணங்கள் கொண்டவை அல்லது கூடுதல் சூழல் இல்லாமல் தீர்க்கவே முடியாத சிக்கல்கள். இதற்கு நேர்மாறாக, “Verified” பதிப்பு அந்த குழப்பங்களை வேண்டுமென்றே வடிகட்டுகிறது. இது அதிக மதிப்பெண்களை எட்டக்கூடிய வகையில், சுத்தமான மற்றும் எளிதில் கையாளக்கூடிய சிக்கல்களை வழங்குகிறது.
இந்த இரண்டு பதிப்புகளும் சிக்கல்களின் வெவ்வேறு பகுதிகளை அளவிடுவதால், சதவீதத்தை நேரடியாக ஒப்பிடுவது தவறான புரிதலை ஏற்படுத்தும். 1.96% என்ற புள்ளி, வடிகட்டப்படாத மூலப் பணிகளில் உள்ள செயல்திறனைக் காட்டுகிறது; 72.7% என்ற புள்ளி, வெற்றி பெறுவதற்கான வாய்ப்புகள் மிக அதிகமாக உள்ள ஒரு தேர்ந்தெடுக்கப்பட்ட மாதிரியில் உள்ள செயல்திறனைக் காட்டுகிறது.
இலக்கு வைக்கப்பட்ட பொறியியல்
டெவலப்பர்கள் பெஞ்ச்மார்க்கை அணுகும் முறையில் இரண்டாவது, நுணுக்கமான மாற்றம் ஏற்பட்டது. 2023-இல், SWE-bench-இல் சிறந்து விளங்குவதற்காக யாரும் பிரத்யேகமாக ஏஜென்ட்களை உருவாக்கவில்லை; அந்தத் தேர்வு உலகின் குறியீட்டு சவால்களின் ஒரு தற்செயலான மாதிரியாகச் செயல்பட்டது. 2025-ஆம் ஆண்டிற்குள், குழுக்கள் இந்த பெஞ்ச்மார்க்கை ஒரு மதிப்பெண் பலகையாக (scoreboard) மாற்றினர். “Verified” தொகுப்பில் அதிக மதிப்பெண் பெறுவதை நோக்கமாகக் கொண்டு, அவர்கள் ஸ்காஃபோல்டிங் (scaffolding), ப்ராம்ப்டிங் உத்திகள் (prompting strategies) மற்றும் ஃபைன்-டியூன் செய்யப்பட்ட மாடல்களை உருவாக்கினர்.
பொறியாளர்கள் ஒரு குறிப்பிட்ட தேர்வில் வெற்றி பெறுவதற்காக ஒரு அமைப்பை வடிவமைக்கும்போது, அந்த மதிப்பெண் அந்த அமைப்பு அந்தத் தேர்வுக்கு எவ்வளவு பொருத்தமானது என்பதையே காட்டுகிறதே தவிர, அதன் பரந்த திறனை அல்ல. அந்த பெஞ்ச்மார்க் “சரிசெய்யப்பட்டு” ஒரு இலக்காக மாறிய அடுத்த கணமே, அது நிஜ உலகப் பணிகளின் பிரதிநிதித்துவ மாதிரியாக இருப்பதைக் கைவிட்டது.
இந்த உயர்வு உண்மையில் எதைக் குறிக்கிறது
தற்போதைய குறியீட்டு ஏஜென்ட்கள் அசல் தொகுப்பை விட “Verified” பணிகளில் வியக்கத்தக்க வகையில் சிறப்பாகச் செயல்படுகின்றன என்பதால், செய்திகளில் வரும் அந்த முன்னேற்றம் உண்மையானதுதான். அதே தேர்ந்தெடுக்கப்பட்ட பெஞ்ச்மார்க்கை நம்பியிருக்கும் போட்டிகள், ஆராய்ச்சித் தாள்கள் மற்றும் தயாரிப்பு விளக்கங்களுக்கு (product demos) அந்த முன்னேற்றம் முக்கியமானது.
இருப்பினும், இந்த உயர்வு AI ஏஜென்ட்கள் அன்றாட மென்பொருள் மேம்பாட்டின் சிக்கல்களைக் கையாள முடியும் என்பதை நிரூபிப்பதில்லை. அசல் 2,294 சிக்கல்கள் கொண்ட தொகுப்பு இன்னும் உள்ளது, மேலும் அந்தப் பதிப்பிற்கான மதிப்பெண்கள் இன்னும் குறைவாகவே உள்ளன.
கேட்க வேண்டிய கேள்விகள்
பெஞ்ச்மார்க் முடிவுகளில் மிகப்பெரிய மாற்றத்தைக் காணும்போது, இந்த மூன்று சோதனைகளை நினைவில் கொள்ளுங்கள்:
- எந்தப் பதிவைப் பற்றி அறிக்கை செய்யப்படுகிறது? அசல் (Original), லைட் (Lite) அல்லது வெரிஃபைட் (Verified)? ஒரே மாதிரியான பெயர்கள் முற்றிலும் மாறுபட்ட பணிகளின் தொகுப்புகளை மறைக்கக்கூடும்.
- எது வடிகட்டப்பட்டது? குழப்பமான அல்லது தீர்க்க முடியாத பணிகளை நீக்குவது எந்தவொரு அமைப்பிற்கும் அதன் உச்சகட்டத் திறனை (ceiling) உயர்த்துகிறது; அதே சமயம் உற்பத்திச் சூழலில் (production) முக்கியமான சவால்களையும் அது நீக்கிவிடுகிறது.
- இந்த குறிப்பிட்டத் தேர்வில் வெற்றி பெறுவதற்காகவே அந்த அமைப்பு உருவாக்கப்பட்டதா? டெவலப்பர்கள் பெஞ்ச்மார்க்கிற்காக மாடல்களையோ அல்லது பைப்லைன்களையோ (pipelines) சரிசெய்திருந்தால், அந்த மதிப்பெண் மேம்படுத்தப்பட்ட செயல்திறனை (optimization) மட்டுமே அளவிடுகிறதே தவிர, அதன் உண்மையான திறனை அல்ல.
முன்னோக்கிப் பார்ப்போம்
இத்தகைய பாதுகாப்பு முறைகள் தரநிலையாக மாறும் வரை, ஒரு AI குறியீட்டாளரின் பயனுள்ளতার சிறந்த அளவுகோல், டெவலப்பர்கள் தினமும் எதிர்கொள்ளும் குழப்பமான, நிஜ உலகச் சிக்கல்களில் அதன் செயல்திறனாகவே இருக்கும்.
முக்கியக் கருத்து: சரிசெய்யப்பட்ட, இலக்கு வைக்கப்பட்ட பெஞ்ச்மார்க்கில் அதிக மதிப்பெண் பெறுவது, AI ஏஜென்ட்கள் நிஜ உலக குறியீட்டுச் சிக்கல்களுக்குத் தயாராகிவிட்டன என்பதைத் தானாகவே நிரூபிப்பதில்லை; பொறியாளர்கள் ஒவ்வொரு நாளும் போராடும் வடிகட்டப்படாத சிக்கல்களே உண்மையான சோதனை.
