OpenAI ने जाहीर केले की त्यांच्या GPT-5.6 Sol मॉडेलने ARC-AGI-3 लॉजिक बेंचमार्कवर ३८.३ टक्के स्कोअर मिळवला आहे, जो Anthropic च्या Claude Opus 5 (३०.२ टक्के) पेक्षा जास्त आहे. या दाव्यामुळे तांत्रिक वाद निर्माण झाला कारण बेंचमार्कच्या अधिकृत टेस्ट हार्नेसद्वारे (test harness) चालवल्यास त्याच मॉडेलने केवळ ७.८ टक्के स्कोअर मिळवला.
ARC-AGI-3 स्कोअर का महत्त्वाचा आहे
ARC-AGI-3 हे मॉडेल केवळ पाठांतर केलेल्या पॅटर्नवर अवलंबून न राहता, नवीन आणि तर्कशुद्ध (reasoning-heavy) समस्या सोडवण्याच्या क्षमतेची चाचणी घेते. संशोधक या स्कोअरचा वापर "general-intelligence" च्या प्रगतीचा निकष म्हणून करतात, त्यामुळे १० अंकी आघाडी ही मानवासारख्या समस्या सोडवण्याच्या दिशेने एक महत्त्वपूर्ण पाऊल मानली जाते. केवळ याच कारणामुळे या बातमीने AI समुदायामध्ये खळबळ माजवली.
छुपे घटक: Retained Reasoning आणि Compaction
OpenAI ने GPT-5.6 Sol चे मूल्यमापन सार्वजनिक टेस्ट हार्नेसद्वारे केले नाही. त्याऐवजी त्यांनी त्यांच्या स्वतःच्या Responses API चा वापर केला, ज्यामध्ये दोन खास (proprietary) पर्याय होते:
- Retained Reasoning – हे मॉडेलची विचार प्रक्रिया (chain of thought) अनेक टप्प्यांपर्यंत जिवंत ठेवते, ज्यामुळे प्रत्येक टप्पा स्वतंत्रपणे हाताळल्यामुळे होणारी मध्यवर्ती तर्काची (intermediate logic) हानी टाळता येते.
- Compaction – हे आधीचा संदर्भ (context) काढून टाकण्याऐवजी तो संकुचित (compress) करते, ज्यामुळे मॉडेलला अधिक दीर्घ आणि सारांशित इतिहासाचा संदर्भ घेता येतो.
जेव्हा हे सेटिंग्ज सक्रिय असतात, तेव्हा मॉडेल अधिक दीर्घ युक्तिवाद एकत्र करते आणि आधीचे निष्कर्ष पुन्हा वापरते, ज्यामुळे बहु-टप्प्यांच्या (multi-step) कामांमध्ये कामगिरी वाढते. अधिकृत हार्नेसमध्ये, जो प्रत्येक कृतीनंतर तर्क (reasoning) काढून टाकतो, त्याच मॉडेलचा स्कोअर ७.८ टक्क्यांपर्यंत खाली येतो, ज्यामुळे ते Claude Opus 5 पेक्षा खूप मागे पडते.
OpenAI असा युक्तिवाद करते की बेंचमार्कने केवळ कच्च्या न्यूरल वेट्सचे (raw neural weights) मोजमाप न करता संपूर्ण इन्फरन्स पाइपलाइनचे (inference pipeline) मोजमाप केले पाहिजे. त्या दृष्टिकोनातून, "wrapper" – म्हणजेच संदर्भ जतन आणि संकुचित करणारा API लॉजिक – हा मूल्यमापन केल्या जाणाऱ्या प्रणालीचाच एक भाग आहे.
निष्पक्षतेचा वाद
बेंचमार्क प्रायोजित करणाऱ्या ARC Prize चे सह-संस्थापक François Chollet यांनी यावर आपले मत मांडले. त्यांनी बेंचमार्क "सोडवण्यासाठी" तयार केलेले कस्टम हार्नेस आणि कोणताही वापरकर्ता सक्षम करू शकणारे सामान्य-उद्देशीय (general-purpose) API सेटिंग्ज यातील फरक स्पष्ट केला. Chollet यांनी नमूद केले की मूळ ARC Prize चा टेस्टिंग एन्व्हायरनमेंट हा जुन्या OpenAI-style completions API वर आधारित होता, ज्यामध्ये Anthropic च्या Claude API मध्ये उपलब्ध असलेल्या प्रगत वैशिष्ट्यांचा अभाव होता. या विसंगतीमुळे सुरुवातीच्या फेऱ्यांमध्ये OpenAI ला तोटा सहन करावा लागला असावा.
त्यांनी ही तुलना अवैध ठरवली नाही. Chollet म्हणाले की, जर नेमकी सेटिंग्ज आणि संबंधित खर्च स्पष्टपणे उघड केले असतील, तर थेट तुलना करणे स्वीकारार्ह आहे. पारदर्शकतेमुळे समुदायाला हे तपासता येईल की ही तफावत मॉडेल आर्किटेक्चरमुळे आहे, इंजिनिअरिंग ट्रिक्समुळे आहे की दोन्हीमुळे.
कोणाचा फायदा आणि कोणाचे नुकसान
जर उच्च स्कोअर स्वीकारला गेला, तर OpenAI ला सार्वजनिक प्रतिमेत फायदा होईल आणि एंटरप्राइझ लायसन्सिंग चर्चेत त्यांची स्थिती मजबूत होईल. Claude च्या टीमला हे सिद्ध करण्यासाठी प्रमाणित हार्नेसवरील 'raw-model' कामगिरीचा दाखला देता येईल की, अतिरिक्त इंजिनिअरिंग लेयर्स काढून टाकल्यास त्यांचे आर्किटेक्चर अधिक कार्यक्षम आहे.
गुंतवणूक करण्यासाठी बेंचमार्क रँकिंगवर अवलंबून असणाऱ्या संशोधक आणि डेव्हलपर्सना ही घटना अस्वस्थ करणारी वाटू शकते. या प्रकरणावरून असे दिसून येते की, मॉडेल्स जसजसे मोठे होत आहेत, तसतसे त्यांच्या इन्फरन्सचे नियोजन करणारे सॉफ्टवेअर निर्णायक ठरू शकते. ज्या कंपन्या कमी खर्चात प्रगत इन्फरन्स स्टॅक्स (inference stacks) उपलब्ध करून देतात, त्या उत्कृष्ट मूळ मॉडेल नसतानाही हेडलाईन स्कोअरमध्ये वर्चस्व गाजवू शकतात.
ARC-AGI-3 आणि इतर बेंचमार्कसाठी पुढे काय?
या वादामुळे ARC Prize आयोजकांना अनुज्ञेय (permissible) इन्फरन्स कॉन्फिगरेशनबाबत अधिक कडक नियम लागू करण्यास भाग पाडले जाऊ शकते. संभाव्य उपाय खालीलप्रमाणे असू शकतात:
- केवळ अधिकृत हार्नेससह कामगिरी दर्शवणारा "baseline" स्कोअर प्रकाशित करणे.
- सहभागींना कोणत्याही अतिरिक्त सेटिंग्जच्या खर्चाचे विश्लेषण सादर करणे अनिवार्य करणे, जेणेकरून उच्च स्कोअरची तुलना अतिरिक्त कॉम्प्युट किंवा इंजिनिअरिंग ओव्हरहेडशी करता येईल.
- एक स्वतंत्र "system-level" ट्रॅक जोडणे जो संदर्भ-व्यवस्थापन (context-management) वैशिष्ट्यांच्या चतुर वापरासाठी बक्षीस देईल.
अशा हालचालींमुळे कच्ची मॉडेल क्षमता (raw model capability) आणि इंजिनिअरिंग ऑप्टिमायझेशन यांच्यात स्पष्ट फरक निर्माण होईल, ज्यामुळे भविष्यातील दाव्यांची तुलना करणे सोपे होईल.
प्रतिवाद: बेंचमार्कने वास्तविक जगातील वापराचे प्रतिबिंब उमटवले पाहिजे
एका बाजूने असा युक्तिवाद केला जातो की केवळ "raw-model-only" हा दृष्टिकोन वास्तववादी नाही. प्रत्यक्ष वापरामध्ये (production), डेव्हलपर्स नियमितपणे लँग्वेज मॉडेल्सवर कॅशिंग (caching), कॉन्टेक्स्ट समरायझेशन (context summarisation) आणि इतर तंत्रांचा वापर करतात. जर बेंचमार्कचा उद्देश व्यावहारिक उपयुक्तता मोजणे असेल, तर त्याने अशा ऑप्टिमायझेशनला परवानगी दिली पाहिजे किंवा त्यांना प्रोत्साहन दिले पाहिजे. त्या दृष्टीकोनातून, OpenAI चे Retained Reasoning आणि Compaction हे वैध साधने आहेत जे कोणताही स्पर्धक वापरू शकतो, जर ते सार्वजनिकरित्या दस्तऐवजीकृत (documented) असतील तर.
टीकाकारांचा असा प्रतिवाद आहे की, समान बेसलाइनशिवाय, स्कोअर हे बदलणारे लक्ष्य बनतात, ज्यामुळे बेंचमार्कची वस्तुनिष्ठ मापदंड म्हणून असलेली भूमिका क्षीण होते. इकोलॉजिकल व्हॅलिडिटी (वास्तविक उपयोजनांचे प्रतिबिंब) आणि मेथडोलॉजिकल प्युरिटी (मॉडेलला वेगळे करणे) यांमधील तणाव सध्याच्या वादाला खतपाणी घालत आहे.
मुख्य निष्कर्ष
GPT-5.6 Sol चा दावा AI मूल्यमापनातील वाढत्या विघटनावर प्रकाश टाकतो: मॉडेलची मूळ क्षमता विरुद्ध ती बाहेर काढणारी इंजिनिअरिंग इकोसिस्टम. जोपर्यंत समुदाय इन्फरन्स सेटिंग्स आणि त्यांच्या खर्चाचा पूर्ण खुलासा करण्याची मागणी करत राहील, तोपर्यंत हा वाद जनरल इंटेलिजन्सच्या दिशेने होणाऱ्या प्रगतीचा दृष्टिकोन अस्पष्ट करण्याऐवजी अधिक तीव्र होत जाईल.
