OpenAI کا کہنا ہے کہ اس کے GPT-5.6 Sol ماڈل نے ARC-AGI-3 منطقی استدلال (logical-reasoning) بینچ مارک پر 38.3% کامیابی کی شرح حاصل کی ہے، جو Anthropic کے Claude Opus 5 (30.2%) سے کہیں زیادہ ہے۔ یہ برتری صرف اس وقت نظر آتی ہے جب ماڈل OpenAI کے کسٹم Responses API کے ذریعے چلایا جاتا ہے، جو دو ایسے 'انفرنس ٹائم ٹرکس' (inference-time tricks) کا استعمال کرتا ہے جن کی آفیشل ٹیسٹ ہارس (test harness) اجازت نہیں دیتی۔

پس منظر: بینچ مارک کی ایک ہتھیاروں والی دوڑ

ARC-AGI-3 کسی ماڈل کی یاد شدہ حقائق پر انحصار کیے بغیر نئے اور کثیر مراحل والے مسائل حل کرنے کی صلاحیت کو جانچتا ہے۔ اس سال کے شروع میں Anthropic نے اس بینچ مارک پر چار گنا اضافے کا اعلان کیا تھا، جس سے Opus 5 عوامی لیڈر بورڈ پر سرفہرست آگیا تھا۔ اس نتیجے نے ماڈل کی "خالص" (raw) صلاحیت کے لیے ایک نیا حوالہ قائم کیا کیونکہ آفیشل ہارس ہر مرحلے کے بعد کسی بھی درمیانی استدلال (reasoning) کو ختم کر دیتا ہے، جس سے ماڈل کو ہر بار نئے سرے سے شروع کرنے پر مجبور ہونا پڑتا ہے۔

OpenAI کا دعویٰ بھی اسی مسابقتی ماحول میں سامنے آیا ہے۔ زیادہ اسکور شائع کر کے، کمپنی یہ اشارہ دے رہی ہے کہ اس کی تازہ ترین نسل نہ صرف اپنے بڑے حریف کی منطقی کارکردگی کا مقابلہ کر سکتی ہے بلکہ اس سے آگے بھی نکل سکتی ہے۔ تاہم، یہ سرخی ایک ایسی تکنیکی باریکی کو چھپا دیتی ہے جو اس بات کو بدل رہی ہے کہ کمیونٹی بینچ مارک ٹیبلز کو کس طرح دیکھتی ہے۔

اعداد و شمار کا اصل مطلب کیا ہے

جب GPT-5.6 Sol کا جائزہ اسی آفیشل ARC-AGI-3 ہارس کے تحت لیا جاتا ہے جس نے Opus 5 کو 30.2% کا نتیجہ دیا تھا، تو ماڈل کی کامیابی کی شرح گر کر 7.8% رہ جاتی ہے۔ یہ فرق کوئی خرابی (glitch) نہیں ہے؛ بلکہ یہ ان دو انجینئرڈ فیچرز کا نتیجہ ہے جو OpenAI اپنے ماڈل کے ساتھ فراہم کرتا ہے:

  • Retained Reasoning – ہر ذیلی کام (sub-task) کے بعد 'چین آف تھاٹ' (chain-of-thought) کو ختم کرنے کے بجائے، سسٹم درمیانی متن کو برقرار رکھتا ہے، جس سے ماڈل کو سابقہ استدلال پر واپس جانے اور ایک مجموعی دلیل بنانے کی اجازت ملتی ہے۔
  • Compaction – ٹوکن کی حدود میں رہنے کے لیے پرانے سیاق و سباق (context) کو کاٹنے کے بجائے، یہ ریپر (wrapper) پچھلے مراحل کو ایک مختصر خلاصے میں سمیٹ دیتا ہے، جس سے منطقی تسلسل برقرار رہتا ہے اور پرامپٹ کا سائز بھی قابو میں رہتا ہے۔

یہ دونوں میکانزم ملکیتی (proprietary) Responses API میں موجود ہیں۔ ماڈل کو زیادہ بھرپور اور مسلسل سیاق و سباق فراہم کر کے، OpenAI مؤثر طریقے سے ماڈل کی "یادداشت" کو بڑھاتا ہے اور اسے اپنی ہی استدلال کو دوبارہ استعمال کرنے کی اجازت دیتا ہے۔ اس کے برعکس، آفیشل ہارس ایک سخت "اسٹیٹ لیس" (stateless) موڈ نافذ کرتا ہے جو ان تمام فوائد کو ختم کر دیتا ہے۔

طریقہ کار کیوں اہم ہے

یہ واقعہ AI کی جانچ (evaluation) میں بڑھتی ہوئی تقسیم کو اجاگر کرتا ہے: خالص ماڈل اسکور بمقابلہ سسٹم لیول کی کارکردگی۔ OpenAI کا استدلال ہے کہ ایک بینچ مارک کو اس پورے اسٹیک کی عکاسی کرنی چاہیے جسے ڈویلپرز اصل میں استعمال کریں گے – یعنی ماڈل، انفرنس پائپ لائن، اور میموری مینجمنٹ۔ اس نقطہ نظر سے، 38.3% کا اسکور ایک پروڈکٹ ٹیم کو یہ بتاتا ہے کہ یہ مجموعی پیشکش تنہا جانچے گئے ماڈل کے مقابلے میں زیادہ حقیقی دنیا کے کام حل کر سکتی ہے۔

ناقدین کا کہنا ہے کہ اس سے سائنسی ترقی دھندلا جاتی ہے۔ اگر ہر لیب اپنے مخصوص ریپرز (wrappers) شامل کرنے لگے گی، تو لیڈر بورڈ ماڈل کی ذہانت کے صاف ستھرے موازنے کے بجائے انجینئرنگ کے کرتبوں کا مجموعہ بن کر رہ جائے گا۔ آفیشل ARC-AGI-3 ہارس کا مقصد کھیل کے میدان کو برابر رکھنا ہے، تاکہ یہ یقینی بنایا جا سکے کہ زیادہ نمبر ایک حقیقی طور پر مضبوط بنیادی ماڈل کی نشاندہی کرتے ہیں، نہ کہ ایک زیادہ ہوشیار ریپر۔

ڈویلپرز اور سرمایہ کاروں کے لیے اہمیت

AI پر مبنی مصنوعات بنانے والے اسٹارٹ اپس کے لیے یہ فرق عملی ہے۔ ایک ایسا ماڈل جو استدلال کو برقرار رکھ سکے اور سیاق و سباق کو سمیٹ سکے، اسے حل تک پہنچنے کے لیے کم پرامپٹ انجینئرنگ، کم انفرنس لیٹنسی (latency)، اور کم API کالز کی ضرورت پڑ سکتی ہے۔ اس کا مطلب ہے سستے کمپیوٹ بلز اور صارفین کے لیے بہتر تجربہ۔ وہ کمپنیاں جو ایک مکمل (turnkey) سسٹم فراہم کرتی ہیں – یعنی ماڈل کے ساتھ آپٹیمائزڈ انفرنس لیئر – انہیں وہاں مسابقتی برتری حاصل ہوتی ہے جہاں رفتار اور لاگت اہمیت رکھتی ہے۔

سرمایہ کار مستقبل کی آمدنی کے اشارے کے طور پر بینچ مارک میں ہونے والی ترقی پر نظر رکھتے ہیں۔ ایک بڑی سرخی بننے والی برتری کسی کمپنی کی ویلیویشن (valuation) کو بڑھا سکتی ہے، چاہے بنیادی ماڈل کی خالص صلاحیت حریفوں کے برابر ہی کیوں نہ ہو۔ اس لیے، اعداد و شمار کس چیز کی نمائندگی کرتے ہیں، اس پر بحث اس بات پر اثر انداز ہوتی ہے کہ AI سیکٹر میں سرمایہ کیسے بہتا ہے۔

آگے کیا دیکھنے کی ضرورت ہے

  • معیار مقرر کرنے والوں کے ردعمل – بینچ مارک کے منتظمین "بیرونی" انفرنس ٹرکس کے حوالے سے قوانین سخت کر سکتے ہیں یا ایک الگ "سسٹم" ٹریک شامل کر سکتے ہیں جو واضح طور پر ان کی اجازت دیتا ہو۔ ان کا ردعمل عوامی لیڈر بورڈز کی اگلی لہر کی تشکیل کرے گا۔
  • اوپن سورس ریپرز – اگر کمیونٹی 'ریٹینڈ ریزننگ' اور 'کمپیکشن' کے اپنے طریقے جاری کر دیتی ہے، تو یہ فائدہ ایک ملکیتی برتری کے بجائے ایک بنیادی فیچر بن سکتا ہے۔
  • حقیقی دنیا کے ٹیسٹ بیڈز – کمپنیاں تیزی سے اپنے ملکیتی پرابلم سیٹس (مثلاً اندرونی کوڈ جنریشن سویٹس) پر کارکردگی شائع کر رہی ہیں۔ وہ نتائج، اگرچہ موازنہ کرنا مشکل ہوگا، لیکن ایک واحد عوامی بینچ مارک کے مقابلے میں زیادہ اہمیت رکھنا شروع کر دیں گے۔

مخالف دلیل: کیا یہ بینچ مارک کے ساتھ "کھیلنا" (gaming) ہے؟

کچھ محققین کسٹم APIs کے استعمال کو "benchmark gaming" کا نام دیتے ہیں، ان کا استدلال ہے کہ یہ بنیادی ماڈل کی سمجھ کو آگے بڑھائے بغیر اسکورز کو بڑھا چڑھا کر دکھاتا ہے۔ وہ اس بات کی نشاندہی کرتے ہیں کہ سخت پابندیوں کے تحت کسی ماڈل کی کارکردگی کا سنگل ڈیجٹ تک گر جانا، AGI کے ہدف سے اب بھی بہت دور ہے۔ تشویش یہ ہے کہ یہ شعبہ استدلال کی صلاحیت میں حقیقی چھلانگوں کے بجائے انجینئرنگ کے شارٹ کٹس کو نوازنا شروع کر سکتا ہے۔

OpenAI کا موقف ہے کہ ماڈل اور سسٹم کے درمیان فرق تیزی سے مصنوعی ہوتا جا رہا ہے۔ جدید AI ایپلی کیشنز شاذ و نادر ہی کسی ماڈل کو تنہا چلاتی ہیں؛ وہ ہمیشہ ایک سرونگ لیئر (serving layer) کے پیچھے ہوتی ہیں جو کیشنگ (caching)، سیاق و سباق کی جوڑ توڑ (context stitching) اور آؤٹ پٹ پوسٹ پروسیسنگ کو سنبھالتی ہے۔ اس زاویے سے، پورے پائپ لائن کی پیمائش کرنا اس بارے میں زیادہ ایماندارانہ ہے کہ صارفین اصل میں کیا تجربہ کرتے ہیں۔

خلاصہ

GPT-5.6 Sol کی کہانی یہ ظاہر کرتی ہے کہ آج کی بینچ مارک فتوحات ماڈل کے سائز کے ساتھ ساتھ انفرنس انجینئرنگ (inference engineering) پر بھی اتنی ہی منحصر ہیں۔ آیا کمیونٹی سسٹم لیول کے اسکورز کو اپناتی ہے یا کسٹم ریپرز (custom wrappers) پر قابو پاتی ہے، یہی فیصلہ کرے گا کہ ہم اگلی "leaderboard" کی سرخی کو کس طرح پڑھیں گے۔ AI مصنوعات بنانے یا ان میں سرمایہ کاری کرنے والے کسی بھی شخص کے لیے سبق واضح ہے: خام اعداد و شمار اہمیت رکھتے ہیں، لیکن ارد گرد کا سافٹ ویئر حقیقی دنیا کی کارکردگی میں فیصلہ کن عنصر ثابت ہو سکتا ہے۔