OpenAI தனது GPT-5.6 Sol மாடல் ARC-AGI-3 தர்க்கப் பெஞ்ச்மார்க் (logic benchmark) சோதனையில் 38.3 சதவீத மதிப்பெண்ணைப் பெற்றுள்ளது என்றும், இது Anthropic நிறுவனத்தின் Claude Opus 5 (30.2 சதவீதம்) என்பதை விட outperforms செய்கிறது என்றும் அறிவித்துள்ளது. ஆனால், அதே மாடல் பெஞ்ச்மார்க்கின் அதிகாரப்பூர்வ சோதனை முறையைப் (official test harness) பயன்படுத்தும் போது வெறும் 7.8 சதவீதத்தை மட்டுமே பெற்றதால், இந்த அறிவிப்பு உடனடித் தொழில்நுட்ப விவாதத்தைத் தூண்டியுள்ளது.

ARC-AGI-3 மதிப்பெண் ஏன் முக்கியமானது

ARC-AGI-3 என்பது ஒரு மாடல் மனப்பாடம் செய்யப்பட்ட வடிவங்களைச் சார்ந்து இருக்காமல், முற்றிலும் புதிய மற்றும் ஆழ்ந்த தர்க்கரீதியான சிக்கல்களைத் தீர்க்கும் திறனைச் சோதிக்கிறது. ஆராய்ச்சியாளர்கள் இந்த மதிப்பெண்களை "பொது அறிவு" (general-intelligence) முன்னேற்றத்தின் ஒரு அளவுகோலாகக் கருதுகின்றனர், எனவே பத்து புள்ளிகள் முன்னிலை என்பது மனிதனைப் போன்ற சிக்கல் தீர்க்கும் திறனை நோக்கிய ஒரு குறிப்பிடத்தக்க முன்னேற்றமாகக் கருதப்படுகிறது. இந்தத் தகவல் ஏன் AI சமூகத்தில் பெரும் தாக்கத்தை ஏற்படுத்தியது என்பதற்கு இதுவே காரணம்.

மறைந்திருக்கும் காரணி: Retained Reasoning மற்றும் Compaction

OpenAI தனது GPT-5.6 Sol மாடலை பொதுவான சோதனை முறையைப் பயன்படுத்தி மதிப்பீடு செய்யவில்லை. அதற்குப் பதிலாக, அதன் சொந்த Responses API-ஐப் பயன்படுத்தி இரண்டு பிரத்யேக விருப்பங்களைப் பயன்படுத்தியது:

  • Retained Reasoning – இது மாடலின் சிந்தனைச் சங்கிலியை (chain of thought) பல நிலைகளிலும் உயிர்ப்புடன் வைத்திருக்கிறது, இதன் மூலம் ஒவ்வொரு நிலையையும் தனித்தனியாகக் கையாளும் போது ஏற்படும் இடைநிலைத் தர்க்க இழப்பைத் தடுக்கிறது.
  • Compaction – இது முந்தைய சூழலை (context) நீக்குவதற்குப் பதிலாகச் சுருக்குகிறது, இது மாடல் நீண்ட மற்றும் சுருக்கப்பட்ட வரலாற்றை மேற்கோள் காட்ட அனுமதிக்கிறது.

இந்த அமைப்புகள் செயல்பாட்டில் இருக்கும்போது, மாடல் நீண்ட வாதங்களை ஒன்றிணைத்து, முந்தைய முடிவுகளை மீண்டும் பயன்படுத்துகிறது, இது பல படிநிலைகளைக் கொண்ட பணிகளில் அதன் செயல்திறனை அதிகரிக்கிறது. ஒவ்வொரு செயலுக்குப் பிறகும் தர்க்கத்தை நீக்கிவிடும் அதிகாரப்பூர்வ சோதனை முறையில், அதே மாடலின் மதிப்பெண் 7.8 சதவீதமாகக் குறைந்து, Claude Opus 5-ஐ விடப் பின்தங்கிய நிலையில் உள்ளது.

பெஞ்ச்மார்க் என்பது வெறும் நரம்பியல் எடைகளை (raw neural weights) மட்டும் அளவிடாமல், முழுமையான அனுமானப் பாதையையும் (inference pipeline) அளவிட வேண்டும் என்று OpenAI வாதிடுகிறது. அந்தப் பார்வையில், சூழலைப் பாதுகாத்துச் சுருக்கும் API தர்க்கம் எனப்படும் "wrapper" என்பது மதிப்பீடு செய்யப்படும் அமைப்பின் ஒரு பகுதியே ஆகும்.

நியாயமான தன்மை குறித்த விவாதம்

இந்த பெஞ்ச்மார்க்கை நிதியளிக்கும் ARC Prize-ன் இணை நிறுவனர் François Chollet இது குறித்துக் கருத்துத் தெரிவித்துள்ளார். பெஞ்ச்மார்க்கை "தீர்க்க" உருவாக்கப்பட்ட தனிப்பயனாக்கப்பட்ட சோதனை முறைகளுக்கும் (custom harnesses), எந்தப் பயனரும் பயன்படுத்தக்கூடிய பொதுவான API அமைப்புகளுக்கும் இடையே உள்ள வேறுபாட்டை அவர் சுட்டிக்காட்டினார். அசல் ARC Prize சோதனைச் சூழல் பழைய OpenAI-பாணி completions API-ஐப் பயன்படுத்தியதாகவும், அதில் Anthropic-ன் Claude API-ல் தற்போது இருக்கும் மேம்பட்ட அம்சங்கள் இல்லை என்றும் Chollet குறிப்பிட்டார். இந்த முரண்பாடு முந்தைய சுற்றுகளில் OpenAI-க்கு பாதகமாக இருந்திருக்கலாம்.

இந்த ஒப்பீடு செல்லாது என்று அவர் கூறவில்லை. துல்லியமான அமைப்புகள் மற்றும் அதனுடன் தொடர்புடைய செலவுகள் வெளிப்படையாகத் தெரிவிக்கப்பட்டால், நேரடி ஒப்பீடு ஏற்றுக்கொள்ளத்தக்கது என்று Chollet கூறினார். இந்த இடைவெளி மாடல் கட்டமைப்பு (model architecture) காரணமாக ஏற்படுகிறதா, பொறியியல் நுணுக்கங்களால் (engineering tricks) ஏற்படுகிறதா அல்லது இரண்டாலும் ஏற்படுகிறதா என்பதைச் சமூகத்தால் மதிப்பிட வெளிப்படைத்தன்மை அவசியம் என்று அவர் வாதிட்டார்.

யார் வெற்றி பெறுகிறார்கள், யார் thuaப் போகிறார்கள்

இந்த அதிக மதிப்பெண் அப்படியே ஏற்றுக்கொள்ளப்பட்டால், OpenAI பொதுமக்களிடையே ஒரு நற்பெயரையும், நிறுவன உரிமப் பேச்சுவார்த்தைகளில் (enterprise licensing talks) வலுவான இடத்தையும் பெறும். மறுபுறம், கூடுதல் பொறியியல் அடுக்குகளை நீக்கிய பிறகு, தரப்படுத்தப்பட்ட சோதனை முறையில் தங்கள் கட்டமைப்பு எவ்வளவு திறமையானது என்பதற்கான ஆதாரமாக Claude குழுவினர் மாடலின் நேரடிச் செயல்திறனைக் (raw-model performance) காட்ட முடியும்.

முதலீடுகளைத் தீர்மானிக்க பெஞ்ச்மார்க் தரவரிசைகளை நம்பியிருக்கும் ஆராய்ச்சியாளர்கள் மற்றும் மேம்பாட்டாளர்கள் இந்தச் சம்பவத்தால் நிலைகுலைந்து போகலாம். மாடல்கள் பெரிதாக வளர வளர, அவற்றின் அனுமானத்தை (inference) ஒருங்கிணைக்கும் மென்பொருள் தீர்மானிக்கும் காரணியாக மாறக்கூடும் என்பதை இந்தச் சம்பவம் காட்டுகிறது. குறைந்த செலவில் அதிநவீன அனுமான அடுக்குகளைத் (inference stacks) தயாரிக்கும் நிறுவனங்கள், சிறந்த அடிப்படை மாடல் இல்லாமலேயே தலைப்புச் செய்திகளில் இடம்பெறும் மதிப்பெண்களைக் கைப்பற்றக்கூடும்.

ARC-AGI-3 மற்றும் பிற பெஞ்ச்மார்க்குகளுக்கு அடுத்து என்ன?

இந்த விவாதம், அனுமதிக்கப்பட்ட அனுமானக் கட்டமைப்புகள் (inference configurations) குறித்த கடுமையான விதிகளை உருவாக்க ARC Prize அமைப்பாளர்கள் முன்முயற்சி எடுக்கத் தூண்டும். சாத்தியமான பதில்கள் பின்வருமாறு இருக்கலாம்:

  • அதிகாரப்பூர்வ சோதனை முறையை மட்டும் பயன்படுத்திப் பெறப்படும் செயல்திறனைப் பிரதிபலிக்கும் ஒரு "அடிப்படை" (baseline) மதிப்பெண்ணை வெளியிடுதல்.
  • பங்கேற்பாளர்கள் கூடுதல் அமைப்புகளுக்கான செலவுப் பகுப்பாய்வைச் சமர்ப்பிக்க வேண்டும் என்று கோருதல், இதன் மூலம் அதிக மதிப்பெண்ணை கூடுதல் கணினித் திறன் (compute) அல்லது பொறியியல் செலவுகளுடன் ஒப்பிட்டுப் பார்க்க முடியும்.
  • சூழல் மேலாண்மை அம்சங்களை (context-management features) புத்திசாலித்தனமாகப் பயன்படுத்துவதை வெகுமதி அளிக்கும் ஒரு தனிப்பயனாக்கப்பட்ட "அமைப்பு-நிலை" (system-level) பிரிவைச் சேர்த்தல்.

இத்தகைய நடவடிக்கைகள், அடிப்படை மாடல் திறன் மற்றும் பொறியியல் மேம்படுத்தல் (engineering optimisation) ஆகியவற்றுக்கு இடையே தெளிவான பிரிவை ஏற்படுத்தும், இது எதிர்கால ஒப்பீடுகளை எளிதாக்கும்.

எதிர் வாதம்: பெஞ்ச்மார்க்குகள் நிஜ உலகப் பயன்பாட்டைப் பிரதிபலிக்க வேண்டும்

ஒரு தரப்பு வாதிடுவது என்னவென்றால், கடுமையான "நேரடி-மாடல்-மட்டும்" (raw-model-only) பார்வை யதார்த்தமற்றது என்பதாகும். நடைமுறையில், மேம்பாட்டாளர்கள் மொழி மாடல்களின் மீது caching, context summarisation மற்றும் பிற நுணுக்கங்களை வழக்கமாகப் பயன்படுத்துகின்றனர். ஒரு பெஞ்ச்மார்க் நடைமுறைப் பயன்பாட்டைக் கணிக்க முயல்கிறது என்றால், அது இத்தகைய மேம்படுத்தல்களை அனுமதிக்க வேண்டும் அல்லது ஊக்குவிக்க வேண்டும். அந்தப் பார்வையில், OpenAI-ன் Retained Reasoning மற்றும் Compaction ஆகியவை எந்தவொரு போட்டியாளரும் பயன்படுத்தக்கூடிய முறையான கருவிகளே, அவை பொதுப்படையாக ஆவணப்படுத்தப்பட்டிருக்கும் வரை.

ஒரு பொதுவான அடிப்படைத் தளம் இல்லையென்றால், மதிப்பெண்கள் ஒரு மாறிக்கொண்டே இருக்கும் இலக்காகிவிடும் என்றும், இது ஒரு புறநிலையான அளவுகோலாக பெஞ்ச்மார்க்கின் பங்கினைச் சிதைத்துவிடும் என்றும் விமர்சகர்கள் வாதிடுகின்றனர். சூழலியல் செல்லுபடித்தன்மை (உண்மையான பயன்பாடுகளைப் பிரதிபலித்தல்) மற்றும் முறையியல் தூய்மை (மாதிரியைத் தனிமைப்படுத்துதல்) ஆகியவற்றிற்கு இடையிலான பதற்றம் தற்போதைய சர்ச்சையைத் தூண்டுகிறது.

முக்கியக் கருத்து

GPT-5.6 Sol பற்றியக் கூற்று, AI மதிப்பீட்டில் வளர்ந்து வரும் ஒரு பிளவைச் சுட்டிக்காட்டுகிறது: மாதிரியின் இயல்பான திறமை மற்றும் அதை வெளிக்கொணரும் பொறியியல் சூழல் ஆகியவற்றிற்கு இடையிலான வேறுபாடு. அனுமான அமைப்புகள் (inference settings) மற்றும் அவற்றின் செலவுகள் குறித்த முழுமையான வெளிப்படைத்தன்மையைக் சமூகம் கோரும் வரை, பொது அறிவு (general intelligence) நோக்கிய முன்னேற்றத்தைப் பற்றிய நமது பார்வையை மழுங்கடிக்காமல், இந்த விவாதம் இன்னும் தீவிரமடையும்.