OpenAI తన GPT-5.6 Sol మోడల్ ARC-AGI-3 లాజిక్ బెంచ్‌మార్క్‌లో 38.3 శాతం స్కోరు సాధించిందని, Anthropic యొక్క Claude Opus 5 (30.2 శాతం) కంటే మెరుగ్గా ఉందని ప్రకటించింది. అయితే, అదే మోడల్ బెంచ్‌మార్క్ యొక్క అధికారిక టెస్ట్ హార్నెస్ (official test harness) ద్వారా పరీక్షించినప్పుడు కేవలం 7.8 శాతం మాత్రమే స్కోరు సాధించడంతో, ఈ ప్రకటన తక్షణ సాంకేతిక వివాదానికి దారితీసింది.

ARC-AGI-3 స్కోరు ఎందుకు ముఖ్యం

ARC-AGI-3 అనేది ఒక మోడల్ కేవలం గుర్తుంచుకున్న నమూనాలపై ఆధారపడకుండా, సరికొత్త మరియు తార్కిక ఆలోచన అవసరమయ్యే సమస్యలను పరిష్కరించే సామర్థ్యాన్ని పరీక్షిస్తుంది. పరిశోధకులు ఈ స్కోర్‌లను "జనరల్-ఇంటెలిజెన్స్" (general-intelligence) పురోగతికి ప్రాతినిధ్యంగా భావిస్తారు, కాబట్టి పది పాయింట్ల ఆధిక్యం మానవ స్థాయి సమస్య పరిష్కార సామర్థ్యం వైపు ఒక ముఖ్యమైన అడుగుగా కనిపిస్తుంది. ఈ కారణం వల్లే ఈ వార్త AI రంగంలో పెద్ద సంచలనం సృష్టించింది.

దాగి ఉన్న కీలక అంశం: Retained Reasoning మరియు Compaction

OpenAI, GPT-5.6 Sol ను పబ్లిక్ టెస్ట్ హార్నెస్ ద్వారా అంచనా వేయలేదు. దానికి బదులుగా, అది తన స్వంత Responses APIని రెండు ప్రత్యేకమైన ఆప్షన్లతో ఉపయోగించింది:

  • Retained Reasoning – ఇది మోడల్ యొక్క ఆలోచనా క్రమాన్ని (chain of thought) అనేక దశల వరకు కొనసాగేలా చేస్తుంది, తద్వారా ప్రతి దశను విడిగా పరిగణించినప్పుడు జరిగే మధ్యంతర తార్కిక నష్టాన్ని నివారిస్తుంది.
  • Compaction – ఇది మునుపటి సందర్భాన్ని (context) తొలగించకుండా కుదిస్తుంది (compress), దీనివల్ల మోడల్ సుదీర్ఘమైన, సారాంశ రూపంలో ఉన్న చరిత్రను రిఫరెన్స్‌గా వాడుకోగలదు.

ఈ సెట్టింగ్‌లు యాక్టివ్‌గా ఉన్నప్పుడు, మోడల్ సుదీర్ఘమైన వాదనలను జోడిస్తుంది మరియు మునుపటి నిర్ణయాలను తిరిగి ఉపయోగిస్తుంది, దీనివల్ల మల్టీ-స్టెప్ టాస్క్‌లలో పనితీరు పెరుగుతుంది. ప్రతి చర్య తర్వాత తార్కికతను తొలగించే అధికారిక హార్నెస్ (official harness) లో, అదే మోడల్ స్కోరు 7.8 శాతానికి పడిపోతుంది, ఇది Claude Opus 5 కంటే చాలా తక్కువ.

బెంచ్‌మార్క్ అనేది కేవలం ముడి న్యూరల్ వెయిట్స్ (raw neural weights) మాత్రమే కాకుండా, మొత్తం ఇన్ఫరెన్స్ పైప్‌లైన్‌ను (inference pipeline) కొలవాలని OpenAI వాదిస్తోంది. ఆ కోణంలో చూస్తే, సందర్భాన్ని నిలుపుకునే మరియు కుదింపు చేసే "వ్యాపర్" (wrapper) – అంటే API లాజిక్ – అంచనా వేయబడే వ్యవస్థలో భాగమే.

నిష్పాక్షికతపై చర్చ

ఈ బెంచ్‌మార్క్‌ను స్పాన్సర్ చేసే ARC Prize సహ వ్యవస్థాపకుడు François Chollet దీనిపై స్పందించారు. బెంచ్‌మార్క్‌ను "పరిష్కరించడానికి" నిర్మించిన కస్టమ్ హార్నెస్ లు మరియు ఏ వినియోగదారుడైనా ఉపయోగించగల జనరల్-పర్పస్ API సెట్టింగ్‌ల మధ్య ఆయన తేడాను వివరించారు. పాత OpenAI-శైలి కంప్లీషన్స్ APIని అసలు ARC Prize టెస్టింగ్ ఎన్విరాన్మెంట్ ఉపయోగించిందని, అందులో Anthropic యొక్క Claude APIలో ఉన్న అధునాతన ఫీచర్లు లేవని Chollet పేర్కొన్నారు. ఈ తేడా వల్ల మునుపటి రౌండ్లలో OpenAIకి నష్టం వాటిల్లి ఉండవచ్చు.

అయితే, ఈ పోలిక చెల్లదని ఆయన చెప్పలేదు. ఖచ్చితమైన సెట్టింగ్‌లు మరియు దానికి సంబంధించిన ఖర్చులను వెల్లడిస్తే, ఇలాంటి పోలికలను అంగీకరించవచ్చని Chollet అన్నారు. పారదర్శకత ఉంటేనే, ఈ వ్యత్యాసం మోడల్ ఆర్కిటెక్చర్ వల్ల వచ్చిందా, ఇంజనీరింగ్ ట్రిక్స్ వల్ల వచ్చిందా లేదా రెండింటి వల్ల వచ్చిందా అనేది కమ్యూనిటీ అంచనా వేయగలదని ఆయన వాదించారు.

ఎవరు గెలుస్తారు, ఎవరు ఓడిపోతారు

ఒకవేళ ఈ అధిక స్కోరును యథాతథంగా అంగీకరిస్తే, OpenAIకి ప్రజల దృష్టిలో గుర్తింపు మరియు ఎంటర్‌ప్రైజ్ లైసెన్సింగ్ చర్చల్లో బలమైన స్థితి లభిస్తుంది. మరోవైపు, అదనపు ఇంజనీరింగ్ లేయర్‌లను తొలగించినప్పుడు తమ ఆర్కిటెక్చర్ ఎంత సమర్థవంతంగా ఉంటుందో నిరూపించడానికి Claude బృందం స్టాండర్డైజ్డ్ హార్నెస్ పై వచ్చిన ముడి-మోడల్ (raw-model) పనితీరును సాక్ష్యంగా చూపవచ్చు.

పెట్టుబడుల కోసం బెంచ్‌మార్క్ ర్యాంకింగ్‌లపై ఆధారపడే పరిశోధకులు మరియు డెవలపర్లు ఈ పరిణామం వల్ల ఆందోళన చెందవచ్చు. మోడల్స్ పరిమాణం పెరిగేకొద్దీ, వాటి ఇన్ఫరెన్స్‌ను నిర్వహించే సాఫ్ట్‌వేర్ నిర్ణయాత్మక పాత్ర పోషిస్తుందని ఈ కేసు చూపుతోంది. తక్కువ ఖర్చుతో అధునాతన ఇన్ఫరెన్స్ స్టాక్‌లను అందించే కంపెనీలు, మెరుగైన మోడల్ లేకపోయినా హెడ్ లైన్ స్కోర్‌లను శాసించగలవు.

ARC-AGI-3 మరియు ఇతర బెంచ్‌మార్క్‌ల భవిష్యత్తు ఏమిటి

ఈ వివాదం కారణంగా ARC Prize నిర్వాహకులు అనుమతించదగిన ఇన్ఫరెన్స్ కాన్ఫిగరేషన్‌ల (inference configurations) గురించి కఠినమైన నిబంధనలను తీసుకురావడానికి అవకాశం ఉంది. సాధ్యమయ్యే చర్యలు ఇవి కావచ్చు:

  • అధికారిక హార్నెస్ ద్వారా మాత్రమే వచ్చే పనితీరును ప్రతిబింబించేలా ఒక "బేస్‌లైన్" (baseline) స్కోరును ప్రచురించడం.
  • పాల్గొనేవారు అదనపు సెట్టింగ్‌ల కోసం చేసే ఖర్చుల విశ్లేషణను సమర్పించాలని కోరడం, తద్వారా అధిక స్కోరును అదనపు కంప్యూట్ లేదా ఇంజనీరింగ్ ఖర్చులతో పోల్చి చూడవచ్చు.
  • సందర్భ నిర్వహణ (context-management) ఫీచర్లను తెలివిగా ఉపయోగించినందుకు రివార్డులు ఇచ్చే ప్రత్యేకమైన "సిస్టమ్-లెవల్" (system-level) ట్రాక్‌ను చేర్చడం.

ఇటువంటి చర్యలు ముడి మోడల్ సామర్థ్యానికి మరియు ఇంజనీరింగ్ ఆప్టిమైజేషన్‌కు మధ్య స్పష్టమైన విభజనను తీసుకువస్తాయి, తద్వారా భవిష్యత్తులో వచ్చే క్లెయిమ్‌లను పోల్చడం సులభమవుతుంది.

ప్రతివాదన: బెంచ్‌మార్క్‌లు వాస్తవ ప్రపంచ వినియోగాన్ని ప్రతిబింబించాలి

కేవలం "ముడి-మోడల్-మాత్రమే" (raw-model-only) చూడటం వాస్తవికం కాదని ఒక వర్గం వాదిస్తోంది. వాస్తవ ఉత్పత్తిలో (production), డెవలపర్లు భాషా మోడల్‌లపై క్యాషింగ్ (caching), కాంటెక్స్ట్ సమ్మరైజేషన్ (context summarisation) మరియు ఇతర పద్ధతులను క్రమం తప్పకుండా ఉపయోగిస్తారు. ఒక బెంచ్‌మార్క్ యొక్క లక్ష్యం ఆచరణాత్మక ప్రయోజనాన్ని అంచనా వేయడమే అయితే, అది అటువంటి ఆప్టిమైజేషన్‌లను అనుమతించాలి లేదా ప్రోత్సహించాలి. ఆ కోణంలో చూస్తే, OpenAI యొక్క Retained Reasoning మరియు Compaction అనేవి ఏ పోటీదారుడైనా అనుసరించగలిగే చట్టబద్ధమైన సాధనాలు, అయితే అవి బహిరంగంగా డాక్యుమెంట్ చేయబడాలి.

ఒక ఉమ్మడి ప్రాతిపదిక లేకపోతే, స్కోర్లు మారుతూ ఉంటాయి, ఇది బెంచ్‌మార్క్ యొక్క నిష్పాక్షిక కొలమానం అనే పాత్రను దెబ్బతీస్తుందని విమర్శకులు వాదిస్తున్నారు. ఎకోలాజికల్ వాలిడిటీ (నిజమైన వినియోగాన్ని ప్రతిబింబించడం) మరియు మెథడలాజికల్ ప్యూరిటీ (మోడల్‌ను వేరు చేయడం) మధ్య ఉన్న సంఘర్షణ ప్రస్తుత వివాదానికి కారణమవుతోంది.

ముగింపు

GPT-5.6 Sol క్లెయిమ్, AI మూల్యాంకనంలో పెరుగుతున్న విభజనను వెలుగులోకి తెస్తోంది: మోడల్ యొక్క సహజ సామర్థ్యం మరియు దానిని వెలికితీసే ఇంజనీరింగ్ ఎకోసిస్టమ్ మధ్య ఉన్న వ్యత్యాసం. ఇన్ఫరెన్స్ సెట్టింగ్‌లు మరియు వాటి ఖర్చుల గురించి పూర్తి వివరాలను కమ్యూనిటీ డిమాండ్ చేసేంత కాలం, ఈ చర్చ జనరల్ ఇంటెలిజెన్స్ వైపు సాగుతున్న పురోగతిపై మన అవగాహనను అస్పష్టం చేయకుండా, మరింత తీవ్రమవుతూనే ఉంటుంది.