OpenAI એ જાહેરાત કરી હતી કે તેના GPT-5.6 Sol મોડેલે ARC-AGI-3 લોજિક બેન્ચમાર્ક પર 38.3 ટકા સ્કોર મેળવ્યો છે, જે Anthropic ના Claude Opus 5 (30.2 ટકા) કરતા વધુ છે. આ દાવાને કારણે તાત્કાલિક ટેકનિકલ વિવાદ ઊભો થયો કારણ કે જ્યારે આ જ મોડેલને બેન્ચમાર્કના સત્તાવાર ટેસ્ટ હાર્નેસ (test harness) દ્વારા ચલાવવામાં આવ્યું, ત્યારે તેનો સ્કોર માત્ર 7.8 ટકા રહ્યો હતો.
ARC-AGI-3 સ્કોર શા માટે મહત્વનો છે
ARC-AGI-3 મોડેલની યાદ રાખેલા પેટર્ન પર આધાર રાખવાને બદલે, બ્રાન્ડ-ન્યૂ અને તર્કસંગત (reasoning-heavy) સમસ્યાઓ ઉકેલવાની ક્ષમતાને તપાસે છે. સંશોધકો આ સ્કોરને "જનરલ-ઇન્ટેલિજન્સ" (સામાન્ય બુદ્ધિ) ની પ્રગતિના માપદંડ તરીકે ગણાવે છે, તેથી દસ પોઈન્ટની લીડ માનવ જેવી સમસ્યા ઉકેલવાની ક્ષમતા તરફનું એક મોટું કદમ લાગે છે. આ બાબત જ સમજાવે છે કે શા માટે આ હેડલાઇન AI સમુદાયમાં ચર્ચાનો વિષય બની ગઈ.
છુપાયેલું સાધન: Retained Reasoning અને Compaction
OpenAI એ GPT-5.6 Sol નું મૂલ્યાંકન પબ્લિક ટેસ્ટ હાર્નેસ દ્વારા કર્યું નથી. તેના બદલે, તેણે તેના પોતાના Responses API નો ઉપયોગ બે પ્રોપ્રાઇટરી (proprietary) વિકલ્પો સાથે કર્યો:
- Retained Reasoning – મોડેલના વિચારના પ્રવાહને (chain of thought) અનેક તબક્કાઓ સુધી જીવંત રાખે છે, જેનાથી દરેક તબક્કાને અલગથી લેવામાં આવે ત્યારે થતા મધ્યવર્તી તર્ક (intermediate logic) ના નુકસાનને અટકાવે છે.
- Compaction – અગાઉના સંદર્ભને (context) કાપી નાખવાને બદલે તેને સંકુચિત (compress) કરે છે, જેનાથી મોડેલ લાંબા અને સારાંશિત ઇતિહાસનો સંદર્ભ લઈ શકે છે.
જ્યારે આ સેટિંગ્સ સક્રિય હોય છે, ત્યારે મોડેલ લાંબી દલીલોને જોડી દે છે અને અગાઉના તારણોનો ફરીથી ઉપયોગ કરે છે, જેનાથી મલ્ટી-સ્ટેપ કાર્યોમાં તેની કામગીરી વધી જાય છે. સત્તાવાર હાર્નેસમાં, જે દરેક ક્રિયા પછી તર્કને કાઢી નાખે છે, ત્યાં આ જ મોડેલનો સ્કોર ઘટીને 7.8 ટકા થઈ જાય છે, જે તેને Claude Opus 5 કરતા ઘણું નીચે લાવે છે.
OpenAI એવી દલીલ કરે છે કે બેન્ચમાર્ક એ આખી ઇન્ફરન્સ પાઇપલાઇન (inference pipeline) ને માપવો જોઈએ, માત્ર રો (raw) ન્યુરલ વેટ્સને નહીં. તે દૃષ્ટિકોણથી, "વોરેપર" (wrapper) – એટલે કે સંદર્ભને સાચવતું અને સંકુચિત કરતું API લોજિક – એ મૂલ્યાંકન કરવામાં આવતી સિસ્ટમનો જ એક ભાગ છે.
ન્યાયીપણું અંગેનો વિવાદ
આ બેન્ચમાર્ક સ્પોન્સર કરનાર ARC Prize ના સહ-સ્થાપક ફ્રાન્કોઇસ ચોલેટ (François Chollet) એ આ બાબતે પોતાનો મત આપ્યો. તેમણે બેન્ચમાર્કને "ઉકેલવા" માટે બનાવેલા કસ્ટમ હાર્નેસ અને કોઈપણ વપરાશકર્તા સક્રિય કરી શકે તેવા જનરલ-પર્પઝ API સેટિંગ્સ વચ્ચે તફાવત સ્પષ્ટ કર્યો. ચોલેટે નોંધ્યું કે મૂળ ARC Prize ટેસ્ટિંગ એન્વાયરમેન્ટમાં જૂના OpenAI-સ્ટાઇલના completions API નો ઉપયોગ કરવામાં આવ્યો હતો, જેમાં Anthropic ના Claude API માં ઉપલબ્ધ અદ્યતન સુવિધાઓનો અભાવ હતો. આ અસમાનતાને કારણે અગાઉના રાઉન્ડમાં OpenAI ને નુકસાન થયું હોઈ શકે છે.
તેમણે સરખામણીને અમાન્ય જાહેર કરવાનું ટાળ્યું. ચોલેટે કહ્યું કે જો ચોક્કસ સેટિંગ્સ અને તેની સાથે જોડાયેલા ખર્ચ જાહેર કરવામાં આવે, તો સીધી સરખામણીનો દાવો સ્વીકાર્ય રહે છે. તેમણે દલીલ કરી કે પારદર્શિતાથી સમુદાય એ નક્કી કરી શકશે કે આ તફાવત મોડેલ આર્કિટેક્ચરને કારણે છે, એન્જિનિયરિંગ ટ્રિક્સને કારણે છે, અથવા બંનેને કારણે છે.
કોણ જીતે છે, કોણ હારે છે
જો ઊંચા સ્કોરને સીધો સ્વીકારી લેવામાં આવે, તો OpenAI ને જાહેર છબીમાં વધારો થશે અને એન્ટરપ્રાઇઝ લાયસન્સિંગની વાતચીતમાં મજબૂત પકડ મળશે. Claude ની ટીમ પ્રમાણિત હાર્નેસ પર રો-મોડેલની કામગીરીને પુરાવા તરીકે રજૂ કરી શકે છે કે જ્યારે વધારાના એન્જિનિયરિંગ લેયર્સ દૂર કરવામાં આવે છે, ત્યારે તેમનું આર્કિટેક્ચર વધુ કાર્યક્ષમ છે.
સંશોધકો અને ડેવલપર્સ જેઓ રોકાણ કરવા માટે બેન્ચમાર્ક રેન્કિંગ પર આધાર રાખે છે, તેઓ આ ઘટનાથી અસ્વસ્થ થઈ શકે છે. આ કિસ્સો દર્શાવે છે કે જેમ જેમ મોડેલ્સ મોટા થતા જાય છે, તેમ તેમ તેમના ઇન્ફરન્સનું સંચાલન કરતું સોફ્ટવેર નિર્ણાયક બની શકે છે. જે કંપનીઓ ઓછા માર્જિનલ ખર્ચે અત્યાધુનિક ઇન્ફરન્સ સ્ટેક્સ (inference stacks) પૂરા પાડે છે, તેઓ શ્રેષ્ઠ અન્ડરલાઇંગ મોડેલ વગર પણ હેડલાઇન સ્કોર્સમાં પ્રભુત્વ મેળવી શકે છે.
ARC-AGI-3 અને અન્ય બેન્ચમાર્ક માટે આગળ શું?
આ વિવાદથી ARC Prize ના સંચાલકો સંભવિત ઇન્ફરન્સ કોન્ફિગરેશન વિશે કડક નિયમો તરફ આગળ વધી શકે છે. સંભવિત પ્રતિસાદોમાં નીચેનાનો સમાવેશ થઈ શકે છે:
- માત્ર સત્તાવાર હાર્નેસ સાથેની કામગીરી દર્શાવતો "બેઝલાઇન" (baseline) સ્કોર પ્રકાશિત કરવો.
- સહભાગીઓને કોઈપણ વધારાના સેટિંગ્સનું કોસ્ટ એનાલિસિસ સબમિટ કરવા માટે કહેવું, જેથી ઊંચા સ્કોરને વધારાના કમ્પ્યુટ અથવા એન્જિનિયરિંગ ખર્ચ સામે તુલના કરી શકાય.
- એક અલગ "સિસ્ટમ-લેવલ" ટ્રેક ઉમેરવો જે કોન્ટેક્સ્ટ-મેનેજમેન્ટ સુવિધાઓના ચતુર ઉપયોગને પ્રોત્સાહન આપે.
આવા પગલાં રો-મોડેલ ક્ષમતા અને એન્જિનિયરિંગ ઓપ્ટિમાઇઝેશન વચ્ચે સ્પષ્ટ વિભાજન લાવશે, જેનાથી ભવિષ્યના દાવાઓની સરખામણી કરવી સરળ બનશે.
વિરોધી દલીલ: બેન્ચમાર્ક વાસ્તવિક દુનિયાના ઉપયોગને પ્રતિબિંબિત કરવા જોઈએ
એક પક્ષ એવી દલીલ કરે છે કે કડક "માત્ર રો-મોડેલ" નો દૃષ્ટિકોણ અવાસ્તવિક છે. પ્રોડક્શનમાં, ડેવલપર્સ નિયમિતપણે લેંગ્વેજ મોડેલ્સ પર કેશિંગ (caching), કોન્ટેક્સ્ટ સમરાઇઝેશન અને અન્ય ટ્રિક્સનો ઉપયોગ કરે છે. જો બેન્ચમાર્કનો હેતુ વ્યવહારુ ઉપયોગિતાનું અનુમાન લગાવવાનો હોય, તો તેણે તે ઓપ્ટિમાઇઝેશન્સને મંજૂરી આપવી જોઈએ - અથવા પ્રોત્સાહિત પણ કરવા જોઈએ. તે દૃષ્ટિકોણથી, OpenAI ના Retained Reasoning અને Compaction એ કાયદેસરના સાધનો છે જેને કોઈપણ સ્પર્ધક અપનાવી શકે છે, જો તે જાહેરમાં દસ્તાવેજીકૃત હોય.
ટીકાકારો એવી દલીલ કરે છે કે સમાન બેઝલાઇન વિના, સ્કોર્સ એક બદલાતા લક્ષ્ય બની જાય છે, જે એક નિષ્પક્ષ માપદંડ તરીકે બેન્ચમાર્કની ભૂમિકાને નબળી પાડે છે. ઇકોલોજીકલ વેલિડિટી (વાસ્તવિક ઉપયોગોનું પ્રતિબિંબ) અને પદ્ધતિસરની શુદ્ધતા (મોડેલને અલગ પાડવું) વચ્ચેનો તણાવ વર્તમાન વિવાદને વધુ તેજ બનાવે છે.
મુખ્ય સારાંશ
GPT-5.6 Sol નો દાવો AI મૂલ્યાંકનમાં વધતા જતા વિભાજનને ઉજાગર કરે છે: મોડેલની મૂળભૂત ક્ષમતા વિરુદ્ધ તેને બહાર લાવતી એન્જિનિયરિંગ ઇકોસિસ્ટમ. જ્યાં સુધી સમુદાય ઇન્ફરન્સ સેટિંગ્સ અને તેના ખર્ચના સંપૂર્ણ ખુલાસાની માંગણી કરશે, ત્યાં સુધી આ ચર્ચા જનરલ ઇન્ટેલિજન્સ તરફની પ્રગતિના આપણા દૃષ્ટિકોણને અસ્પષ્ટ કરવાને બદલે વધુ તીવ્ર બનાવશે.
