مدل GPT-5.6 Sol Ultra از OpenAI یک حدس ریاضی ۵۰ ساله را حل کرد

گزارش‌ها حاکی از آن است که جدیدترین مدل استدلالی OpenAI، یعنی GPT-5.6 Sol Ultra، با حل یک حدس ریاضی که از دهه ۱۹۷۰ باز مانده بود، به پیشرفتی بزرگ در نظریه گراف دست یافته است. این مدل با بهره‌گیری از پایداری محاسباتی فوق‌العاده و یک معماری چندعاملی (multi-agent)، در کمتر از یک ساعت یک اثبات کامل ارائه کرد.

حل معمای نظریه گراف

حدس مورد نظر به یک پرسش بنیادی در نظریه گراف می‌پردازد: آیا می‌توان مجموعه‌ای از چرخه‌ها را در هر شبکه از رأس‌ها و یال‌ها یافت که از هر یال به‌طور دقیق دو بار عبور کند؟ اگرچه ریاضی‌دانان در طول پنج دهه گذشته راه‌حل‌های جزئی برای موارد خاص یافته‌اند، اما اثبات کلی همچنان دست‌نیافتنی باقی مانده بود.

توماس بلوم، ریاضی‌دان دانشگاه منچستر، این اثبات را «کوتاه، ابتدایی و چیزی که می‌توانست در دهه ۱۹۸۰ کشف شود» توصیف کرد. جالب اینجاست که این راه حل نیازی به ابداع نظریه‌های ریاضی کاملاً جدید نداشت؛ بلکه به شکلی هوشمندانه، ابزارهای موجود و چارچوب‌های ریاضی شناخته‌شده را با هم ترکیب کرده بود.

قدرت پایداری ماشین

یک پرسش حیاتی مطرح می‌شود: اگر ریاضیات آن «ابتدایی» بود، چرا انسان‌ها ۵۰ سال در حل آن شکست خوردند؟ بلوم معتقد است که راه حل مستلزم یک چرخش کوچک و خلاف شهود در استدلال بود. ریاضی‌دانان انسانی اغلب مسیرهای منطقی‌ای را دنبال می‌کنند که در صورت شکست، منجر به این نتیجه‌گیری می‌شود که مسئله حل‌ناپذیر است.

در مقابل، GPT-5.6 Sol Ultra سطحی از «پایداری ماشین» را از خود نشان می‌دهد. این مدل دچار سوگیری شناختیِ ناامیدی نمی‌شود. در عوض، مدل به‌طور مداوم تغییرات بسیار جزئی در منطق و برچسب‌گذاری را بررسی می‌کند تا زمانی که یک مسیر موفق شناسایی شود. این توانایی در اجرای brute-force روی جایگشت‌های منطقی بدون «شانه بالا انداختن از سر ناامیدی»، به هوش مصنوعی اجازه داد تا از موانع ذهنی که پژوهشگران انسانی را متوقف کرده بود، عبور کند.

مهندسی پرامپت پیشرفته و معماری چندعاملی

موفقیت Sol Ultra صرفاً نتیجه هوش خام نبود، بلکه حاصل مهندسی پرامپت بسیار پیچیده بود. برای اطمینان از اینکه مدل به پاسخ پیش‌فرض «نمی‌دانم» متوسل نشود، محققان از مجموعه‌ای از دستورالعمل‌های سختگیرانه استفاده کردند:

  • فرض اجباری: پرامپت مدل را مجبور می‌کرد فرض کند که یک اثبات کامل وجود دارد، تا از بیان این مطلب که حدس حل‌نشده است، جلوگیری شود.
  • ایزولاسیون اطلاعات: مدل از جستجو در اینترنت برای تأیید اینکه آیا مسئله قبلاً حل شده است یا خیر، منع شده بود.
  • تست تقابلی چندعاملی: از سیستمی متشکل از ۶۴ عامل (agent) استفاده شد. بسیاری از آن‌ها از اینکه کدام رویکرد منطقی در حال کار است «بی‌خبر» نگه داشته شدند تا استدلال مستقل تضمین شود، در حالی که عوامل تقابلی (adversarial agents)، اثبات‌های کاندید را برای خطاهای خاص، مانند شناسایی نادرست مسیرهای بسته، به دقت بررسی می‌کردند.

بحث بر سر خلاقیت هوش مصنوعی و ارجاع‌دهی

این پیشرفت بحث‌ها را در مورد اینکه آیا LLMها واقعاً «خلاق» هستند یا صرفاً ترکیب‌کنندگان پیچیده دانش موجود، دوباره شعله‌ور کرده است. بلوم خاطرنشان کرد که ایده‌های اصلی در این اثبات به مقاله‌ای در سال ۱۹۸۳ توسط Bermond، Jackson و Jaeger بازمی‌گردد. او از OpenAI به دلیل عدم ارجاع به این کار قبلی انتقاد کرد و اشاره کرد که مقالات تولید شده توسط هوش مصنوعی اغلب از استراتژی‌های موجود بدون ارجاع مناسب استفاده می‌کنند.

در حالی که جامعه علمی هنوز در انتظار تأیید ریاضی کامل است، این رویداد نشان‌دهنده تغییری در چشم‌انداز هوش مصنوعی است. مدل‌های هوش مصنوعی در مقیاس بزرگ به‌طور فزاینده‌ای برای حمله به مسائل علمی باز به کار گرفته می‌شوند و پتانسیل کشف راه‌حل‌هایی را دارند که تمام این مدت در دسترس انسان بوده‌اند.

نکات کلیدی

  • پایداری فراتر از پیچیدگی: هوش مصنوعی یک مسئله دیرینه را نه با ابداع ریاضیات جدید، بلکه با به‌کارگیری نظریه‌های موجود با سطحی از تنوع منطقی خستگی‌ناپذیر که انسان فاقد آن است، حل کرد.
  • محدودیت‌های سختگیرانه نتایج را رقم می‌زنند: استفاده از پرامپت‌های «تقابلی» و ممنوعیت جستجوی اینترنت، مدل را مجبور کرد تا به جای ارائه پاسخ استاندارد «حل‌نشده»، یک راه حل پیدا کند.
  • چالش ارجاع‌دهی: این حادثه نگرانی فزاینده‌ای را در تحقیقات هوش مصنوعی در مورد عدم ارجاع مناسب هنگام ترکیب مجدد ادبیات علمی موجود توسط مدل‌ها برجسته می‌کند.