OpenAI का कहना है कि उसके GPT-5.6 Sol मॉडल ने ARC-AGI-3 लॉजिकल-रीज़निंग बेंचमार्क पर 38.3% की सफलता दर हासिल की है, जो Anthropic के Claude Opus 5 (30.2%) से आगे है। यह बढ़त केवल तभी दिखाई देती है जब मॉडल OpenAI के कस्टम Responses API के माध्यम से चलता है, जो दो ऐसे इन्फरेंस-टाइम (inference-time) ट्रिक्स जोड़ता है जिनकी आधिकारिक टेस्ट हार्नेस (test harness) अनुमति नहीं देती है।

पृष्ठभूमि: एक बेंचमार्क हथियारों की दौड़

ARC-AGI-3 किसी मॉडल की रटे-रटाए तथ्यों पर निर्भर रहे बिना, नए और बहु-चरणीय (multi-step) समस्याओं को हल करने की क्षमता की जांच करता है। इस साल की शुरुआत में Anthropic ने इस बेंचमार्क पर चार गुना उछाल की घोषणा की थी, जिससे Opus 5 सार्वजनिक लीडरबोर्ड में शीर्ष पर पहुंच गया था। उस परिणाम ने मॉडल की "रॉ" (raw) क्षमता के लिए एक नया संदर्भ बिंदु स्थापित किया क्योंकि आधिकारिक हार्नेस प्रत्येक चरण के बाद किसी भी मध्यवर्ती तर्क (intermediate reasoning) को हटा देता है, जिससे मॉडल को हर बार नए सिरे से शुरुआत करने के लिए मजबूर होना पड़ता है।

OpenAI का दावा इसी प्रतिस्पर्धी माहौल में आया है। अधिक स्कोर प्रकाशित करके, कंपनी यह संकेत दे रही है कि उसकी नवीनतम पीढ़ी न केवल अपने मुख्य प्रतिद्वंद्वी के लॉजिकल प्रदर्शन का मुकाबला कर सकती है, बल्कि उससे आगे भी निकल सकती है। हालाँकि, यह हेडलाइन एक तकनीकी बारीकी को छिपाती है जो इस बात को नया रूप दे रही है कि समुदाय बेंचमार्क तालिकाओं को कैसे पढ़ता है।

इन आंकड़ों का वास्तविक अर्थ क्या है

जब GPT-5.6 Sol का मूल्यांकन उसी आधिकारिक ARC-AGI-3 हार्नेस के तहत किया जाता है जिसने Opus 5 को 30.2% का परिणाम दिया था, तो मॉडल की सफलता दर गिरकर 7.8% रह जाती है। यह बदलाव कोई तकनीकी खराबी (glitch) नहीं है; बल्कि यह उन दो इंजीनियर की गई विशेषताओं का परिणाम है जिन्हें OpenAI मॉडल के साथ जोड़ता है:

  • Retained Reasoning – प्रत्येक सब-टास्क के बाद चेन-ऑफ-थॉट (chain-of-thought) को मिटाने के बजाय, सिस्टम मध्यवर्ती टेक्स्ट को जीवित रखता है, जिससे मॉडल पिछले निष्कर्षों का संदर्भ ले सकता है और एक संचयी तर्क (cumulative argument) बना सकता है।
  • Compaction – टोकन सीमाओं के भीतर रहने के लिए पुराने संदर्भ को काटने के बजाय, रैपर पिछले चरणों को एक संक्षिप्त सारांश में कंप्रेस कर देता है, जिससे प्रॉम्प्ट का आकार प्रबंधनीय रहता है और तार्किक प्रवाह (logical thread) भी बना रहता है।

ये दोनों तंत्र प्रोप्रायटरी Responses API में मौजूद हैं। मॉडल को अधिक समृद्ध और निरंतर संदर्भ प्रदान करके, OpenAI प्रभावी रूप से मॉडल की "मेमोरी" को बढ़ाता है और इसे अपने स्वयं के तर्क का पुन: उपयोग करने की अनुमति देता है। इसके विपरीत, आधिकारिक हार्नेस एक सख्त "स्टेटलेस" (stateless) मोड लागू करता है जो उन लाभों को समाप्त कर देता है।

कार्यप्रणाली (Methodology) क्यों महत्वपूर्ण है

यह घटना AI मूल्यांकन में बढ़ते विभाजन को उजागर करती है: रॉ मॉडल स्कोर बनाम सिस्टम-स्तर का प्रदर्शन। OpenAI का तर्क है कि एक बेंचमार्क को उस पूरे स्टैक को प्रतिबिंबित करना चाहिए जिसे डेवलपर्स वास्तव में तैनात (deploy) करेंगे - मॉडल, इन्फरेंस पाइपलाइन और मेमोरी मैनेजमेंट। उस दृष्टिकोण से, 38.3% का स्कोर एक प्रोडक्ट टीम को बताता है कि संयुक्त पेशकश अकेले मूल्यांकित मॉडल की तुलना में अधिक वास्तविक दुनिया के कार्यों को हल कर सकती है।

आलोचकों का कहना है कि इससे वैज्ञानिक प्रगति धुंधली हो जाती है। यदि प्रत्येक लैब अपने स्वयं के कस्टम रैपर जोड़ती है, तो लीडरबोर्ड मॉडल की बुद्धिमत्ता की स्वच्छ तुलना के बजाय इंजीनियरिंग ट्रिक्स का एक मिश्रण बन जाएगा। आधिकारिक ARC-AGI-3 हार्नेस खेल के मैदान को समान बनाने के लिए मौजूद है, यह सुनिश्चित करने के लिए कि उच्च संख्या वास्तव में एक मजबूत अंतर्निहित मॉडल का संकेत दे, न कि एक स्मार्ट रैपर का।

डेवलपर्स और निवेशकों के लिए दांव

AI-संचालित उत्पाद बनाने वाले स्टार्टअप्स के लिए, यह अंतर व्यावहारिक है। एक मॉडल जो तर्क को बनाए रख सकता है और संदर्भ को कंपैक्ट कर सकता है, उसे समाधान तक पहुँचने के लिए कम प्रॉम्प्ट इंजीनियरिंग, कम इन्फरेंस लेटेंसी (latency) और कम API कॉल की आवश्यकता हो सकती है। इसका अर्थ है सस्ते कंप्यूट बिल और बेहतर यूजर अनुभव। जो कंपनियाँ टर्नकी सिस्टम (turnkey system) - मॉडल प्लस ऑप्टिमाइज्ड इन्फरेंस लेयर - प्रदान करती हैं, उन्हें वहां प्रतिस्पर्धात्मक बढ़त मिलती है जहां गति और लागत मायने रखती है।

निवेशक भविष्य के राजस्व के संकेतक के रूप में बेंचमार्क में होने वाली वृद्धि पर नज़र रखते हैं। हेडलाइन बटोरने वाली बढ़त किसी फर्म के मूल्यांकन (valuation) को बढ़ा सकती है, भले ही अंतर्निहित मॉडल की रॉ क्षमता प्रतिद्वंद्वियों के बराबर ही क्यों न हो। इसलिए, आंकड़े क्या दर्शाते हैं, इस पर होने वाली बहस यह प्रभावित करती है कि AI क्षेत्र में पूंजी का प्रवाह कैसे होता है।

आगे क्या देखने की आवश्यकता है

  • मानक निर्धारित करने वालों की प्रतिक्रिया – बेंचमार्क आयोजक "बाहरी" इन्फरेंस ट्रिक्स के आसपास के नियमों को कड़ा कर सकते हैं या एक अलग "सिस्टम" ट्रैक जोड़ सकते हैं जो स्पष्ट रूप से उनकी अनुमति देता हो। उनकी प्रतिक्रिया सार्वजनिक लीडरबोर्ड की अगली लहर को आकार देगी।
  • ओपन-सोर्स रैपर – यदि समुदाय रिटेन्ड रीजनिंग (retained reasoning) और कॉम्पेक्शन (compaction) के अपने स्वयं के कार्यान्वयन जारी करता है, तो यह लाभ एक प्रोप्रायटरी बढ़त के बजाय एक आधारभूत विशेषता (baseline feature) बन सकता है।
  • वास्तविक दुनिया के टेस्टबेड – कंपनियाँ तेजी से प्रोप्रायटरी समस्या सेट (जैसे, आंतरिक कोड-जेनरेशन सुइट्स) पर अपना प्रदर्शन पोस्ट कर रही हैं। वे परिणाम, हालांकि कम तुलनीय होंगे, एक एकल सार्वजनिक बेंचमार्क की तुलना में अधिक महत्वपूर्ण होने लगेंगे।

प्रति-तर्क: क्या यह बेंचमार्क के साथ "खेला" (gaming) जा रहा है?

कुछ शोधकर्ता कस्टम APIs के उपयोग को "benchmark gaming" का नाम देते हैं, उनका तर्क है कि यह मॉडल की मूल समझ को आगे बढ़ाए बिना स्कोर को बढ़ा-चढ़ाकर दिखाता है। वे इस बात की ओर इशारा करते हैं कि सख्त सीमाओं के तहत किसी मॉडल का प्रदर्शन घटकर सिंगल-डिजिट (single-digit) तक रह जाना, अभी भी AGI के लक्ष्य से बहुत दूर है। चिंता यह है कि यह क्षेत्र तर्क करने की क्षमता (reasoning ability) में वास्तविक प्रगति के बजाय इंजीनियरिंग शॉर्टकट को पुरस्कृत करना शुरू कर सकता है।

OpenAI का पक्ष इस बात पर जोर देता है कि मॉडल और सिस्टम के बीच की रेखा तेजी से कृत्रिम होती जा रही है। आधुनिक AI एप्लिकेशन शायद ही कभी किसी मॉडल को शून्य (vacuum) में चलाते हैं; वे हमेशा एक सर्विंग लेयर (serving layer) के पीछे होते हैं जो कैशिंग, कॉन्टेक्स्ट स्टिचिंग और आउटपुट पोस्ट-प्रोसेसिंग को संभालती है। उस दृष्टिकोण से, पूरे पाइपलाइन को मापना इस बारे में अधिक ईमानदार है कि उपयोगकर्ता वास्तव में क्या अनुभव करते हैं।

निष्कर्ष

GPT-5.6 Sol की कहानी दिखाती है कि आज की बेंचमार्क जीत मॉडल के आकार के साथ-साथ इन्फरेंस इंजीनियरिंग (inference engineering) पर भी उतनी ही निर्भर करती है। समुदाय सिस्टम-लेवल स्कोर को अपनाता है या कस्टम रैपर्स (custom wrappers) पर लगाम लगाता है, यह तय करेगा कि हम अगली "लीडरबोर्ड" हेडलाइन को कैसे पढ़ते हैं। AI उत्पाद बनाने या उन्हें वित्तपोषित करने वाले किसी भी व्यक्ति के लिए सबक स्पष्ट है: कच्चे आंकड़े मायने रखते हैं, लेकिन आसपास का सॉफ्टवेयर वास्तविक दुनिया के प्रदर्शन में निर्णायक कारक हो सकता है।