OpenAI می‌گوید مدل GPT-5.6 Sol آن به نرخ موفقیت ۳۸.۳ درصدی در بنچمارک استدلال منطقی ARC-AGI-3 دست یافته است که از مدل Claude Opus 5 شرکت Anthropic با نرخ ۳۰.۲ درصد پیشی گرفته است. این برتری تنها زمانی ظاهر می‌شود که مدل از طریق Responses API اختصاصی OpenAI اجرا شود، که دو ترفند در زمان استنتاج (inference-time) را اضافه می‌کند که ابزار رسمی تست اجازه استفاده از آن‌ها را نمی‌دهد.

پیش‌زمینه: مسابقه تسلیحاتی در بنچمارک‌ها

ARC-AGI-3 توانایی یک مدل را در حل مسائل جدید و چندمرحله‌ای بدون تکیه بر حقایق حفظ‌شده می‌سنجد. اوایل امسال، Anthropic جهشی چهار برابری در این بنچمارک را اعلام کرد که Opus 5 را در صدر جدول امتیازات عمومی قرار داد. آن نتیجه، نقطه مرجع جدیدی برای توانایی «خام» مدل تعیین کرد، زیرا ابزار رسمی تست، هرگونه استدلال میانی را پس از هر مرحله حذف می‌کند و مدل را مجبور می‌کند که هر بار از نو شروع کند.

ادعای OpenAI در همان فضای رقابتی مطرح می‌شود. شرکت با انتشار امتیازی بالاتر، سیگنال می‌دهد که نسل جدید مدل‌هایش نه تنها می‌تواند با عملکرد منطقی رقیب اصلی خود برابری کند، بلکه از آن فراتر رود. با این حال، این تیتر خبری، یک نکته فنی ظریف را پنهان می‌کند که نحوه خوانش جداول بنچمارک توسط جامعه علمی را تغییر می‌دهد.

معنای واقعی اعداد چیست

وقتی GPT-5.6 Sol تحت همان ابزار رسمی ARC-AGI-3 ارزیابی می‌شود که به Opus 5 نتیجه ۳۰.۲ درصدی را داده بود، نرخ موفقیت مدل به ۷.۸ درصد سقوط می‌کند. این تغییر ناگهانی یک خطا نیست؛ بلکه نتیجه دو ویژگی مهندسی‌شده است که OpenAI همراه با مدل ارائه می‌دهد:

  • استدلال حفظ‌شده (Retained Reasoning) – به جای پاک کردن زنجیره تفکر (chain-of-thought) پس از هر زیر-وظیفه، سیستم متن میانی را زنده نگه می‌دارد و به مدل اجازه می‌دهد به استنتاج‌های قبلی ارجاع داده و یک استدلال تجمعی بسازد.
  • فشرده‌سازی (Compaction) – به جای کوتاه کردن بافت (context) قدیمی برای ماندن در محدودیت‌های توکن (token limits)، این پوشش (wrapper) مراحل قبلی را در یک خلاصه کوتاه فشرده می‌کند و ضمن حفظ رشته منطقی، اندازه پرامپت را مدیریت‌پذیر نگه می‌دارد.

هر دو مکانیزم در Responses API اختصاصی قرار دارند. OpenAI با تغذیه مدل با یک بافت غنی‌تر و پیوسته، به‌طور مؤثری «حافظه» مدل را تقویت کرده و به آن اجازه می‌دهد از استدلال‌های خود دوباره استفاده کند. در مقابل، ابزار رسمی یک حالت «بدون وضعیت» (stateless) سخت‌گیرانه را اعمال می‌کند که این مزایا را از بین می‌برد.

چرا متدولوژی اهمیت دارد

این ماجرا نشان‌دهنده شکافی رو به رشد در ارزیابی هوش مصنوعی است: امتیازات خام مدل در مقابل عملکرد در سطح سیستم. OpenAI استدلال می‌کند که یک بنچمارک باید کل پشته‌ای (stack) را که توسعه‌دهندگان واقعاً مستقر می‌کنند، منعکس کند – یعنی مدل، خط لوله استنتاج (inference pipeline) و مدیریت حافظه. از این دیدگاه، امتیاز ۳۸.۳ درصدی به یک تیم محصول می‌گوید که این بسته ترکیبی می‌تواند وظایف دنیای واقعی بیشتری را نسبت به مدلی که به صورت ایزوله ارزیابی شده است، حل کند.

منتقدان می‌گویند این کار پیشرفت علمی را مبهم می‌کند. اگر هر آزمایشگاهی پوشش‌های (wrappers) سفارشی خود را اضافه کند، جدول امتیازات به جای مقایسه شفاف هوش مدل، به مجموعه‌ای از ترفندهای مهندسی تبدیل خواهد شد. ابزار رسمی ARC-AGI-3 برای برقراری عدالت در میدان رقابت وجود دارد تا اطمینان حاصل شود که عدد بالاتر نشان‌دهنده یک مدل زیربنایی واقعاً قوی‌تر است، نه یک پوشش هوشمندتر.

پیامدها برای توسعه‌دهندگان و سرمایه‌گذاران

برای استارتاپ‌هایی که محصولات مبتنی بر هوش مصنوعی می‌سازند، این تمایز کاربردی است. مدلی که بتواند استدلال را حفظ کرده و بافت را فشرده کند، ممکن است برای رسیدن به یک راه حل، به مهندسی پرامپت کمتر، تأخیر استنتاج (inference latency) پایین‌تر و فراخوانی‌های API کمتری نیاز داشته باشد. این امر به هزینه‌های محاسباتی ارزان‌تر و تجربه کاربری روان‌تر ترجمه می‌شود. شرکت‌هایی که یک سیستم آماده (turnkey) – شامل مدل به علاوه لایه استنتاج بهینه‌شده – عرضه می‌کنند، در جایی که سرعت و هزینه اهمیت دارد، مزیت رقابتی به دست می‌آورند.

سرمایه‌گذاران صعود در بنچمارک‌ها را به عنوان شاخصی برای درآمد آینده زیر نظر دارند. یک پیشتازی که تیتر اخبار را پر می‌کند، می‌تواند ارزش شرکت را افزایش دهد، حتی اگر توانایی خام مدل با رقبا برابر باشد. بنابراین، بحث بر سر اینکه اعداد نشان‌دهنده چه چیزی هستند، بر نحوه جریان یافتن سرمایه در بخش هوش مصنوعی تأثیر می‌گذارد.

آنچه باید در آینده زیر نظر داشت

  • پاسخ‌های تعیین‌کنندگان استاندارد – سازمان‌دهندگان بنچمارک ممکن است قوانین مربوط به ترفندهای استنتاج «خارجی» را سخت‌گیرانه‌تر کنند یا یک بخش مجزا برای «سیستم» اضافه کنند که صراحتاً اجازه استفاده از آن‌ها را می‌دهد. پاسخ آن‌ها موج بعدی جداول امتیازات عمومی را شکل خواهد داد.
  • پوشش‌های (wrappers) متن‌باز – اگر جامعه علمی پیاده‌سازی‌های خود را از استدلال حفظ‌شده و فشرده‌سازی منتشر کند، این مزیت می‌تواند به جای یک برتری اختصاصی، به یک ویژگی پایه تبدیل شود.
  • محیط‌های تست دنیای واقعی – شرکت‌ها به‌طور فزاینده‌ای عملکرد خود را بر روی مجموعه‌مسائل اختصاصی (مثلاً مجموعه‌های داخلی تولید کد) منتشر می‌کنند. آن نتایج، اگرچه کمتر قابل مقایسه هستند، اما اهمیت بیشتری نسبت به یک بنچمارک عمومی واحد خواهند داشت.

استدلال متقابل: آیا این کار «بازی با قوانین» بنچمارک است؟

برخی پژوهشگران استفاده از APIهای سفارشی را «بازی با بنچمارک» (benchmark gaming) می‌نامند و استدلال می‌کنند که این کار بدون پیشرفت در درک هسته‌ای مدل، باعث تورم امتیازها می‌شود. آن‌ها خاطرنشان می‌کنند مدلی که تحت محدودیت‌های سختگیرانه، عملکردش به اعداد تک‌رقمی سقوط می‌کند، هنوز با هدف AGI فاصله زیادی دارد. نگرانی این است که این حوزه ممکن است به جای جهش‌های واقعی در توانایی استدلال، شروع به پاداش دادن به میان‌برهای مهندسی کند.

دیدگاه OpenAI تأکید دارد که مرز بین مدل و سیستم به‌طور فزاینده‌ای مصنوعی است. اپلیکیشن‌های مدرن هوش مصنوعی به‌ندرت یک مدل را در خلاء اجرا می‌کنند؛ آن‌ها همیشه پشت یک لایه سرویس‌دهی قرار دارند که وظایف کشینگ (caching)، اتصال بافتار (context stitching) و پس‌پردازش خروجی را بر عهده دارد. از این منظر، اندازه‌گیری کل خط لوله (pipeline) نسبت به آنچه کاربران واقعاً تجربه می‌کنند، صادقانه‌تر است.

نکته کلیدی

داستان GPT-5.6 Sol نشان می‌دهد که پیروزی‌های بنچمارکی امروزی، به همان اندازه که به اندازه مدل بستگی دارد، به مهندسی استنتاج (inference engineering) نیز وابسته است. اینکه جامعه [هوش مصنوعی] امتیازهای سطح سیستم را بپذیرد یا جلوی استفاده از پوشش‌های سفارشی (custom wrappers) را بگیرد، تعیین خواهد کرد که چگونه تیتر بعدی «جدول امتیازات» (leaderboard) را بخوانیم. برای هر کسی که در حال ساخت یا تأمین مالی محصولات هوش مصنوعی است، درس روشن است: اعداد خام مهم هستند، اما نرم‌افزار پیرامونی می‌تواند عامل تعیین‌کننده در عملکرد دنیای واقعی باشد.