OpenAI میگوید مدل GPT-5.6 Sol آن به نرخ موفقیت ۳۸.۳ درصدی در بنچمارک استدلال منطقی ARC-AGI-3 دست یافته است که از مدل Claude Opus 5 شرکت Anthropic با نرخ ۳۰.۲ درصد پیشی گرفته است. این برتری تنها زمانی ظاهر میشود که مدل از طریق Responses API اختصاصی OpenAI اجرا شود، که دو ترفند در زمان استنتاج (inference-time) را اضافه میکند که ابزار رسمی تست اجازه استفاده از آنها را نمیدهد.
پیشزمینه: مسابقه تسلیحاتی در بنچمارکها
ARC-AGI-3 توانایی یک مدل را در حل مسائل جدید و چندمرحلهای بدون تکیه بر حقایق حفظشده میسنجد. اوایل امسال، Anthropic جهشی چهار برابری در این بنچمارک را اعلام کرد که Opus 5 را در صدر جدول امتیازات عمومی قرار داد. آن نتیجه، نقطه مرجع جدیدی برای توانایی «خام» مدل تعیین کرد، زیرا ابزار رسمی تست، هرگونه استدلال میانی را پس از هر مرحله حذف میکند و مدل را مجبور میکند که هر بار از نو شروع کند.
ادعای OpenAI در همان فضای رقابتی مطرح میشود. شرکت با انتشار امتیازی بالاتر، سیگنال میدهد که نسل جدید مدلهایش نه تنها میتواند با عملکرد منطقی رقیب اصلی خود برابری کند، بلکه از آن فراتر رود. با این حال، این تیتر خبری، یک نکته فنی ظریف را پنهان میکند که نحوه خوانش جداول بنچمارک توسط جامعه علمی را تغییر میدهد.
معنای واقعی اعداد چیست
وقتی GPT-5.6 Sol تحت همان ابزار رسمی ARC-AGI-3 ارزیابی میشود که به Opus 5 نتیجه ۳۰.۲ درصدی را داده بود، نرخ موفقیت مدل به ۷.۸ درصد سقوط میکند. این تغییر ناگهانی یک خطا نیست؛ بلکه نتیجه دو ویژگی مهندسیشده است که OpenAI همراه با مدل ارائه میدهد:
- استدلال حفظشده (Retained Reasoning) – به جای پاک کردن زنجیره تفکر (chain-of-thought) پس از هر زیر-وظیفه، سیستم متن میانی را زنده نگه میدارد و به مدل اجازه میدهد به استنتاجهای قبلی ارجاع داده و یک استدلال تجمعی بسازد.
- فشردهسازی (Compaction) – به جای کوتاه کردن بافت (context) قدیمی برای ماندن در محدودیتهای توکن (token limits)، این پوشش (wrapper) مراحل قبلی را در یک خلاصه کوتاه فشرده میکند و ضمن حفظ رشته منطقی، اندازه پرامپت را مدیریتپذیر نگه میدارد.
هر دو مکانیزم در Responses API اختصاصی قرار دارند. OpenAI با تغذیه مدل با یک بافت غنیتر و پیوسته، بهطور مؤثری «حافظه» مدل را تقویت کرده و به آن اجازه میدهد از استدلالهای خود دوباره استفاده کند. در مقابل، ابزار رسمی یک حالت «بدون وضعیت» (stateless) سختگیرانه را اعمال میکند که این مزایا را از بین میبرد.
چرا متدولوژی اهمیت دارد
این ماجرا نشاندهنده شکافی رو به رشد در ارزیابی هوش مصنوعی است: امتیازات خام مدل در مقابل عملکرد در سطح سیستم. OpenAI استدلال میکند که یک بنچمارک باید کل پشتهای (stack) را که توسعهدهندگان واقعاً مستقر میکنند، منعکس کند – یعنی مدل، خط لوله استنتاج (inference pipeline) و مدیریت حافظه. از این دیدگاه، امتیاز ۳۸.۳ درصدی به یک تیم محصول میگوید که این بسته ترکیبی میتواند وظایف دنیای واقعی بیشتری را نسبت به مدلی که به صورت ایزوله ارزیابی شده است، حل کند.
منتقدان میگویند این کار پیشرفت علمی را مبهم میکند. اگر هر آزمایشگاهی پوششهای (wrappers) سفارشی خود را اضافه کند، جدول امتیازات به جای مقایسه شفاف هوش مدل، به مجموعهای از ترفندهای مهندسی تبدیل خواهد شد. ابزار رسمی ARC-AGI-3 برای برقراری عدالت در میدان رقابت وجود دارد تا اطمینان حاصل شود که عدد بالاتر نشاندهنده یک مدل زیربنایی واقعاً قویتر است، نه یک پوشش هوشمندتر.
پیامدها برای توسعهدهندگان و سرمایهگذاران
برای استارتاپهایی که محصولات مبتنی بر هوش مصنوعی میسازند، این تمایز کاربردی است. مدلی که بتواند استدلال را حفظ کرده و بافت را فشرده کند، ممکن است برای رسیدن به یک راه حل، به مهندسی پرامپت کمتر، تأخیر استنتاج (inference latency) پایینتر و فراخوانیهای API کمتری نیاز داشته باشد. این امر به هزینههای محاسباتی ارزانتر و تجربه کاربری روانتر ترجمه میشود. شرکتهایی که یک سیستم آماده (turnkey) – شامل مدل به علاوه لایه استنتاج بهینهشده – عرضه میکنند، در جایی که سرعت و هزینه اهمیت دارد، مزیت رقابتی به دست میآورند.
سرمایهگذاران صعود در بنچمارکها را به عنوان شاخصی برای درآمد آینده زیر نظر دارند. یک پیشتازی که تیتر اخبار را پر میکند، میتواند ارزش شرکت را افزایش دهد، حتی اگر توانایی خام مدل با رقبا برابر باشد. بنابراین، بحث بر سر اینکه اعداد نشاندهنده چه چیزی هستند، بر نحوه جریان یافتن سرمایه در بخش هوش مصنوعی تأثیر میگذارد.
آنچه باید در آینده زیر نظر داشت
- پاسخهای تعیینکنندگان استاندارد – سازماندهندگان بنچمارک ممکن است قوانین مربوط به ترفندهای استنتاج «خارجی» را سختگیرانهتر کنند یا یک بخش مجزا برای «سیستم» اضافه کنند که صراحتاً اجازه استفاده از آنها را میدهد. پاسخ آنها موج بعدی جداول امتیازات عمومی را شکل خواهد داد.
- پوششهای (wrappers) متنباز – اگر جامعه علمی پیادهسازیهای خود را از استدلال حفظشده و فشردهسازی منتشر کند، این مزیت میتواند به جای یک برتری اختصاصی، به یک ویژگی پایه تبدیل شود.
- محیطهای تست دنیای واقعی – شرکتها بهطور فزایندهای عملکرد خود را بر روی مجموعهمسائل اختصاصی (مثلاً مجموعههای داخلی تولید کد) منتشر میکنند. آن نتایج، اگرچه کمتر قابل مقایسه هستند، اما اهمیت بیشتری نسبت به یک بنچمارک عمومی واحد خواهند داشت.
استدلال متقابل: آیا این کار «بازی با قوانین» بنچمارک است؟
برخی پژوهشگران استفاده از APIهای سفارشی را «بازی با بنچمارک» (benchmark gaming) مینامند و استدلال میکنند که این کار بدون پیشرفت در درک هستهای مدل، باعث تورم امتیازها میشود. آنها خاطرنشان میکنند مدلی که تحت محدودیتهای سختگیرانه، عملکردش به اعداد تکرقمی سقوط میکند، هنوز با هدف AGI فاصله زیادی دارد. نگرانی این است که این حوزه ممکن است به جای جهشهای واقعی در توانایی استدلال، شروع به پاداش دادن به میانبرهای مهندسی کند.
دیدگاه OpenAI تأکید دارد که مرز بین مدل و سیستم بهطور فزایندهای مصنوعی است. اپلیکیشنهای مدرن هوش مصنوعی بهندرت یک مدل را در خلاء اجرا میکنند؛ آنها همیشه پشت یک لایه سرویسدهی قرار دارند که وظایف کشینگ (caching)، اتصال بافتار (context stitching) و پسپردازش خروجی را بر عهده دارد. از این منظر، اندازهگیری کل خط لوله (pipeline) نسبت به آنچه کاربران واقعاً تجربه میکنند، صادقانهتر است.
نکته کلیدی
داستان GPT-5.6 Sol نشان میدهد که پیروزیهای بنچمارکی امروزی، به همان اندازه که به اندازه مدل بستگی دارد، به مهندسی استنتاج (inference engineering) نیز وابسته است. اینکه جامعه [هوش مصنوعی] امتیازهای سطح سیستم را بپذیرد یا جلوی استفاده از پوششهای سفارشی (custom wrappers) را بگیرد، تعیین خواهد کرد که چگونه تیتر بعدی «جدول امتیازات» (leaderboard) را بخوانیم. برای هر کسی که در حال ساخت یا تأمین مالی محصولات هوش مصنوعی است، درس روشن است: اعداد خام مهم هستند، اما نرمافزار پیرامونی میتواند عامل تعیینکننده در عملکرد دنیای واقعی باشد.
