OpenAI ने घोषणा की कि उसके GPT-5.6 Sol मॉडल ने ARC-AGI-3 लॉजिक बेंचमार्क पर 38.3 प्रतिशत स्कोर हासिल किया है, जो Anthropic के Claude Opus 5 (30.2 प्रतिशत) से आगे है। इस दावे ने तुरंत एक तकनीकी विवाद खड़ा कर दिया क्योंकि जब इसी मॉडल को बेंचमार्क के आधिकारिक टेस्ट हार्नेस (test harness) के माध्यम से चलाया गया, तो इसने केवल 7.8 प्रतिशत स्कोर किया।

ARC-AGI-3 स्कोर क्यों मायने रखता है

ARC-AGI-3 किसी मॉडल की रटे-रटाए पैटर्न पर निर्भर रहने के बजाय, बिल्कुल नई और तर्क-प्रधान (reasoning-heavy) समस्याओं को हल करने की क्षमता की जांच करता है। शोधकर्ता इन स्कोर्स को "सामान्य बुद्धिमत्ता" (general-intelligence) की प्रगति के संकेतक के रूप में देखते हैं, इसलिए दस अंकों की बढ़त मानव जैसी समस्या-समाधान क्षमता की ओर एक महत्वपूर्ण कदम लगती है। केवल यही बात बताती है कि यह खबर AI समुदाय में इतनी चर्चा का विषय क्यों बनी।

छिपा हुआ लीवर: Retained Reasoning और Compaction

OpenAI ने GPT-5.6 Sol का मूल्यांकन सार्वजनिक टेस्ट हार्नेस के साथ नहीं किया। इसके बजाय, इसने दो प्रोप्रायटरी (proprietary) विकल्पों के साथ अपने स्वयं के Responses API का उपयोग किया:

  • Retained Reasoning – यह मॉडल की 'चेन ऑफ थॉट' (chain of thought) को कई चरणों तक जीवित रखता है, जिससे मध्यवर्ती तर्क (intermediate logic) के खोने से बचाव होता है, जो तब होता है जब प्रत्येक चरण को अलग-थलग माना जाता है।
  • Compaction – यह संदर्भ (context) को काटने के बजाय पिछले संदर्भ को कंप्रेस (compress) कर देता है, जिससे मॉडल एक लंबे और संक्षिप्त इतिहास का संदर्भ ले पाता है।

जब ये सेटिंग्स सक्रिय होती हैं, तो मॉडल लंबे तर्कों को आपस में जोड़ता है और पिछले निष्कर्षों का पुन: उपयोग करता है, जिससे मल्टी-स्टेप कार्यों में प्रदर्शन बढ़ जाता है। आधिकारिक हार्नेस में, जो प्रत्येक क्रिया के बाद तर्क को हटा देता है, उसी मॉडल का स्कोर गिरकर 7.8 प्रतिशत रह जाता है, जो इसे Claude Opus 5 से काफी नीचे ले आता है।

OpenAI का तर्क है कि एक बेंचमार्क को केवल रॉ न्यूरल वेट्स (raw neural weights) को ही नहीं, बल्कि पूरे इन्फरेंस पाइपलाइन (inference pipeline) को मापना चाहिए। उस दृष्टिकोण से, "रैपर" (wrapper) – यानी वह API लॉजिक जो संदर्भ को सुरक्षित रखता है और कंपैक्ट करता है – उस सिस्टम का हिस्सा है जिसका मूल्यांकन किया जा रहा है।

निष्पक्षता की बहस

बेंचमार्क को प्रायोजित करने वाले ARC Prize के सह-संस्थापक François Chollet ने इस पर अपनी राय दी। उन्होंने बेंचमार्क को "हल करने" के लिए बनाए गए कस्टम हार्नेस और सामान्य-उद्देश्य वाले API सेटिंग्स के बीच अंतर स्पष्ट किया, जिन्हें कोई भी उपयोगकर्ता सक्षम कर सकता है। Chollet ने उल्लेख किया कि मूल ARC Prize परीक्षण वातावरण में पुराने OpenAI-शैली के completions API का उपयोग किया गया था, जिसमें Anthropic के Claude API में उपलब्ध उन्नत सुविधाओं की कमी थी। उस विसंगति के कारण शुरुआती दौर में OpenAI को नुकसान हो सकता था।

उन्होंने तुलना को अमान्य घोषित करने से परहेज किया। Chollet ने कहा कि यदि सटीक सेटिंग्स और उससे जुड़ी किसी भी लागत का खुलासा किया जाए, तो आमने-सामने का दावा स्वीकार्य है। उन्होंने तर्क दिया कि पारदर्शिता समुदाय को यह आकलन करने की अनुमति देती है कि क्या यह अंतर मॉडल आर्किटेक्चर, इंजीनियरिंग ट्रिक्स, या दोनों के कारण है।

कौन जीतता है, कौन हारता है

यदि उच्च स्कोर को सीधे तौर पर स्वीकार कर लिया जाता है, तो OpenAI को सार्वजनिक धारणा में बढ़त मिलेगी और एंटरप्राइज लाइसेंसिंग वार्ताओं में मजबूत स्थिति प्राप्त होगी। Claude की टीम मानकीकृत हार्नेस पर रॉ-मॉडल के प्रदर्शन को इस प्रमाण के रूप में पेश कर सकती है कि अतिरिक्त इंजीनियरिंग लेयर्स को हटाने पर उनका आर्किटेक्चर अधिक कुशल है।

शोधकर्ता और डेवलपर्स जो निवेश के मार्गदर्शन के लिए बेंचमार्क रैंकिंग पर भरोसा करते हैं, उन्हें यह घटना परेशान करने वाली लग सकती है। यह मामला दिखाता है कि जैसे-जैसे मॉडल बड़े होते जा रहे हैं, उनके इन्फरेंस को संचालित करने वाला सॉफ्टवेयर निर्णायक हो सकता है। जो कंपनियां कम सीमांत लागत (low marginal cost) पर परिष्कृत इन्फरेंस स्टैक प्रदान करती हैं, वे एक बेहतर अंतर्निहित मॉडल के बिना भी हेडलाइन स्कोर्स पर हावी हो सकती हैं।

ARC-AGI-3 और अन्य बेंचमार्क के लिए आगे क्या है

इस विवाद के कारण संभवतः ARC Prize आयोजक अनुमेय इन्फरेंस कॉन्फ़िगरेशन (permissible inference configurations) के बारे में सख्त नियम बनाने की ओर बढ़ेंगे। संभावित प्रतिक्रियाओं में शामिल हैं:

  • केवल आधिकारिक हार्नेस के साथ प्रदर्शन को दर्शाने वाला एक "बेसलाइन" स्कोर प्रकाशित करना।
  • प्रतिभागियों को किसी भी अतिरिक्त सेटिंग का लागत विश्लेषण जमा करने की आवश्यकता होना, ताकि उच्च स्कोर की तुलना अतिरिक्त कंप्यूट या इंजीनियरिंग ओवरहेड से की जा सके।
  • एक अलग "सिस्टम-लेवल" ट्रैक जोड़ना जो संदर्भ-प्रबंधन (context-management) सुविधाओं के चतुर उपयोग को पुरस्कृत करता हो।

ऐसे कदम रॉ मॉडल क्षमता और इंजीनियरिंग ऑप्टिमाइज़ेशन के बीच स्पष्ट अलगाव सुनिश्चित करेंगे, जिससे भविष्य के दावों की तुलना करना आसान हो जाएगा।

प्रति-तर्क: बेंचमार्क वास्तविक दुनिया के उपयोग को दर्शाने चाहिए

एक पक्ष का तर्क है कि सख्त "केवल रॉ-मॉडल" वाला दृष्टिकोण अवास्तविक है। प्रोडक्शन में, डेवलपर्स नियमित रूप से लैंग्वेज मॉडल्स पर कैशिंग (caching), कॉन्टेक्स्ट समराइजेशन (context summarisation) और अन्य ट्रिक्स का उपयोग करते हैं। यदि किसी बेंचमार्क का उद्देश्य व्यावहारिक उपयोगिता का अनुमान लगाना है, तो उसे उन ऑप्टिमाइज़ेशन की अनुमति देनी चाहिए - या उन्हें प्रोत्साहित भी करना चाहिए। उस दृष्टिकोण से, OpenAI के Retained Reasoning और Compaction वैध उपकरण हैं जिन्हें कोई भी प्रतिस्पर्धी अपना सकता है, बशर्ते वे सार्वजनिक रूप से प्रलेखित (documented) हों।

आलोचकों का तर्क है कि एक सामान्य आधार रेखा (baseline) के बिना, स्कोर एक अस्थिर लक्ष्य बन जाते हैं, जिससे एक वस्तुनिष्ठ मानक के रूप में बेंचमार्क की भूमिका क्षीण हो जाती है। पारिस्थितिक वैधता (वास्तविक तैनाती का प्रतिबिंब) और पद्धतिगत शुद्धता (मॉडल को अलग करना) के बीच का तनाव वर्तमान विवाद को हवा दे रहा है।

मुख्य निष्कर्ष

GPT-5.6 Sol का दावा AI मूल्यांकन में बढ़ते विभाजन को उजागर करता है: मॉडल की मूल प्रतिभा बनाम वह इंजीनियरिंग इकोसिस्टम जो इसे निखारता है। जब तक समुदाय इन्फरेंस सेटिंग्स और उनकी लागतों के पूर्ण प्रकटीकरण की मांग करता रहेगा, यह बहस सामान्य बुद्धिमत्ता (general intelligence) की ओर हमारी प्रगति के दृष्टिकोण को धुंधला करने के बजाय और अधिक स्पष्ट करेगी।