OpenAI ने म्हटले आहे की त्यांच्या GPT-5.6 Sol मॉडेलने ARC-AGI-3 लॉजिकल-रीझनिंग बेंचमार्कवर ३८.३% यश मिळवले आहे, जे Anthropic च्या Claude Opus 5 च्या ३०.२% कामगिरीपेक्षा अधिक आहे. ही आघाडी केवळ तेव्हाच दिसून येते जेव्हा मॉडेल OpenAI च्या कस्टम Responses API द्वारे चालवले जाते, जे दोन इन्फरन्स-टाइम ट्रिक्स (inference-time tricks) जोडते ज्यांना अधिकृत टेस्ट हॅर्नेस (test harness) परवानगी देत नाही.
पार्श्वभूमी: बेंचमार्कची शस्त्रस्पर्धा
ARC-AGI-3 मॉडेलची नवीन, बहु-स्तरीय समस्या सोडवण्याची क्षमता तपासते, ज्यामध्ये मॉडेलने पाठ केलेल्या तथ्यांवर अवलंबून राहू नये. या वर्षाच्या सुरुवातीला Anthropic ने बेंचमार्कवर चार पटीने वाढ जाहीर केली होती, ज्यामुळे Opus 5 सार्वजनिक लीडरबोर्डवर अव्वल स्थानी पोहोचले होते. त्या निकालाने "raw" मॉडेल क्षमतेसाठी एक नवीन संदर्भ बिंदू सेट केला कारण अधिकृत हॅर्नेस प्रत्येक टप्प्यानंतरचे कोणतेही मध्यवर्ती तर्क (intermediate reasoning) काढून टाकते, ज्यामुळे मॉडेलला प्रत्येक वेळी नव्याने सुरुवात करणे भाग पडते.
OpenAI चा दावा त्याच स्पर्धात्मक वातावरणात आला आहे. उच्च स्कोअर प्रकाशित करून, कंपनी हे सूचित करत आहे की तिची नवीनतम पिढी केवळ प्रतिस्पर्ध्याच्या लॉजिकल कामगिरीशी जुळवूनच घेणार नाही, तर त्यापेक्षा पुढेही जाईल. तथापि, ही हेडलाईन एक तांत्रिक बारकावा लपवून ठेवते जो बेंचमार्क टेबल्स वाचण्याच्या पद्धतीला नवीन आकार देत आहे.
या आकड्यांचा खरा अर्थ काय आहे
जेव्हा GPT-5.6 Sol चे मूल्यमापन त्याच अधिकृत ARC-AGI-3 हॅर्नेस अंतर्गत केले जाते ज्याने Opus 5 ला ३०.२% निकाल दिला होता, तेव्हा मॉडेलचा यश दर ७.८% पर्यंत खाली येतो. हा बदल कोणताही तांत्रिक दोष (glitch) नाही; तर तो OpenAI ने मॉडेलसोबत जोडलेल्या दोन इंजिनिअर्ड फीचर्सचा परिणाम आहे:
- Retained Reasoning – प्रत्येक उप-कार्यानंतर (sub-task) चेन-ऑफ-थॉट (chain-of-thought) पुसून टाकण्याऐवजी, ही प्रणाली मध्यवर्ती मजकूर जिवंत ठेवते, ज्यामुळे मॉडेलला पूर्वीच्या निष्कर्षांचा संदर्भ घेता येतो आणि एक संचयी युक्तिवाद (cumulative argument) तयार करता येतो.
- Compaction – टोकन मर्यादांमध्ये राहण्यासाठी जुना संदर्भ (context) कापून टाकण्याऐवजी, हे रॅपर (wrapper) मागील टप्प्यांचा संक्षिप्त सारांश तयार करते, ज्यामुळे प्रॉम्प्टचा आकार व्यवस्थापित राहतो आणि तार्किक धागा (logical thread) कायम राहतो.
दोन्ही यंत्रणा प्रोप्रायटरी Responses API मध्ये कार्यरत आहेत. मॉडेलला अधिक समृद्ध आणि निरंतर संदर्भ देऊन, OpenAI प्रभावीपणे मॉडेलची "मेमरी" वाढवते आणि त्याला स्वतःच्या तर्काचा पुन्हा वापर करण्यास मदत करते. याउलट, अधिकृत हॅर्नेस एक कडक "stateless" मोड लागू करते जो हे सर्व फायदे काढून टाकतो.
कार्यपद्धती का महत्त्वाची आहे
हा प्रसंग AI मूल्यमापनातील वाढता दुमत अधोरेखित करतो: रॉ मॉडेल स्कोअर विरुद्ध सिस्टम-लेव्हल परफॉर्मन्स. OpenAI असा युक्तिवाद करते की बेंचमार्कने डेव्हलपर्स प्रत्यक्षात तैनात करतील अशा संपूर्ण स्टॅकचे – मॉडेल, इन्फरन्स पाइपलाइन आणि मेमरी मॅनेजमेंट – प्रतिबिंब उमटवले पाहिजे. त्या दृष्टिकोनातून, ३८.३% स्कोअर प्रॉडक्ट टीमला सांगतो की एकत्रित ऑफरिंग एकाकी मूल्यमापन केलेल्या मॉडेलपेक्षा अधिक वास्तविक जगातील कार्ये सोडवू शकते.
टीकाकारांचे म्हणणे आहे की यामुळे वैज्ञानिक प्रगतीमध्ये अडथळा येतो. जर प्रत्येक लॅबने स्वतःचे विशेष रॅपर्स जोडले, तर लीडरबोर्ड मॉडेलच्या बुद्धिमत्तेची स्वच्छ तुलना करण्याऐवजी इंजिनिअरिंग ट्रिक्सचा एक संच बनून जाईल. अधिकृत ARC-AGI-3 हॅर्नेस खेळाचे मैदान समान करण्यासाठी अस्तित्वात आहे, जेणेकरून उच्च आकडा हा केवळ स्मार्ट रॅपर नसून खरोखरच अधिक मजबूत मूळ मॉडेलचे संकेत देईल.
डेव्हलपर्स आणि गुंतवणूकदारांसाठीचे परिणाम
AI-चालित उत्पादने तयार करणाऱ्या स्टार्टअप्ससाठी, हा फरक व्यावहारिक आहे. जे मॉडेल तर्क लक्षात ठेवू शकते आणि संदर्भाचे संकुचन (compact context) करू शकते, त्याला उपाय शोधण्यासाठी कमी प्रॉम्प्ट इंजिनिअरिंग, कमी इन्फरन्स लॅटन्सी आणि कमी API कॉल्सची आवश्यकता भासू शकते. याचा अर्थ कमी खर्चिक कम्प्युट बिले आणि अधिक सुलभ युजर एक्सपिरियन्स असा होतो. जे कंपन्या 'टर्नकी सिस्टम' (model plus optimized inference layer) प्रदान करतात, त्यांना वेग आणि खर्च महत्त्वाचा असलेल्या ठिकाणी स्पर्धात्मक फायदा मिळतो.
गुंतवणूकदार भविष्यातील महसुलाचे दर्शक म्हणून बेंचमार्कमधील वाढीकडे पाहतात. हेडलाईनमध्ये येणारी आघाडी एखाद्या कंपनीचे मूल्यांकन (valuation) वाढवू शकते, जरी मूळ मॉडेलची क्षमता प्रतिस्पर्ध्यांच्या बरोबरीची असली तरीही. त्यामुळे, हे आकडे नेमके काय दर्शवतात यावरील वाद AI क्षेत्रातील भांडवलाच्या प्रवाहाला प्रभावित करतो.
पुढे काय पाहावे
- मानक-निर्धारकांचे प्रतिसाद – बेंचमार्क आयोजक "बाह्य" इन्फरन्स ट्रिक्सबाबतचे नियम कडक करू शकतात किंवा एक वेगळा "सिस्टम" ट्रॅक जोडू शकतात जो त्यांना स्पष्टपणे परवानगी देतो. त्यांचा प्रतिसाद पुढील सार्वजनिक लीडरबोर्डच्या लाटेला आकार देईल.
- ओपन-सोर्स रॅपर्स – जर समुदायाने रिटेन्ड रीझनिंग आणि कॉम्पाक्शनची स्वतःची अंमलबजावणी (implementations) प्रसिद्ध केली, तर हा फायदा एक खास वैशिष्ट्य न राहता एक मूलभूत वैशिष्ट्य (baseline feature) बनू शकतो.
- वास्तविक जगातील टेस्टबेड्स – कंपन्या अधिकाधिक त्यांच्या स्वतःच्या प्रॉप्रायटरी प्रॉब्लेम सेटवर (उदा. अंतर्गत कोड-जनरेशन सूट्स) कामगिरी पोस्ट करत आहेत. हे निकाल, जरी तुलना करण्यास कमी सोपे असले तरी, एका सार्वजनिक बेंचमार्कपेक्षा अधिक महत्त्वाचे ठरतील.
प्रतिवाद: हे बेंचमार्क "गेमिंग" करणे आहे का?
काही संशोधक कस्टम API च्या वापराला “benchmark gaming” असे संबोधतात, त्यांचे असे म्हणणे आहे की यामुळे मॉडेलच्या मूळ समज वाढवण्याऐवजी केवळ स्कोअर वाढतात. कडक मर्यादांमध्ये मॉडेलची कामगिरी जर एकेरी अंकात खाली आली, तर ते अजूनही AGI च्या उद्दिष्टापासून खूप दूर आहे, असे ते नमूद करतात. काळजी अशी आहे की, हे क्षेत्र तर्कशक्तीमधील (reasoning ability) वास्तविक प्रगतीपेक्षा इंजिनिअरिंगमधील शॉर्टकटना अधिक महत्त्व देऊ लागेल.
OpenAI च्या बाजूने असा युक्तिवाद केला जातो की मॉडेल आणि सिस्टममधील रेषा अधिकाधिक कृत्रिम होत चालली आहे. आधुनिक AI ॲप्लिकेशन्स क्वचितच मॉडेलला स्वतंत्रपणे चालवतात; ते नेहमी एका सर्व्हिंग लेयरच्या मागे असतात जे कॅशिंग, कॉन्टेक्स्ट स्टिचिंग आणि आउटपुट पोस्ट-प्रोसेसिंग हाताळते. त्या दृष्टीकोनातून पाहिले तर, संपूर्ण पाइपलाइन मोजणे हे वापरकर्त्यांना प्रत्यक्षात काय अनुभव येतो याबद्दल अधिक प्रामाणिक आहे.
निष्कर्ष
GPT-5.6 Sol ची कथा हे दर्शवते की आजच्या बेंचमार्क विजय हे मॉडेलच्या आकारासोबतच इन्फरन्स इंजिनिअरिंगवर देखील अवलंबून आहेत. समुदाय सिस्टम-स्तरीय स्कोअर स्वीकारतो की कस्टम रॅपर्सवर नियंत्रण ठेवतो, यावरून आपण पुढची “leaderboard” हेडलाईन कशी वाचतो हे ठरवले जाईल. AI उत्पादने तयार करणाऱ्या किंवा त्यांना वित्तपुरवठा करणाऱ्या कोणासाठीही धडा स्पष्ट आहे: केवळ कच्चे आकडे महत्त्वाचे नसून, आजूबाजूचे सॉफ्टवेअर हे वास्तविक जगातील कामगिरीमध्ये निर्णायक घटक ठरू शकते.
