مدل Fable 5 شرکت Anthropic توانست در ۱۷۸۵ نوبت و با صرف ۶۵.۴۰ دلار، اولین نشان باشگاه (gym badge) را در نسخه چینی بازی Pokémon FireRed، تنها با استفاده از خروجی بصری بازی، به دست آورد. این اجرا ثابت می‌کند که مدل می‌تواند بخش قابل شناسایی از بازی را بدون هیچ دستور متنی به پایان برساند، اما بررسی دقیق زنجیره تفکر (thinking chain) مدل نشان می‌دهد که آن به جای «دیدن» واقعی و استدلال درباره هر پیکسل، در حال بازگویی دانش حفظ‌شده از بازی بوده است.

آزمون ادعای Anthropic

زمانی که Anthropic مدل Fable 5 را عرضه کرد، این شرکت بر یک دموی «فقط بصری» (vision-only) تأکید داشت که در آن مدل تنها با نگاه کردن به صفحه نمایش، در بازی Pokémon FireRed پیمایش می‌کرد. تیتر خبر طوری به نظر می‌رسید که گویی سیستم می‌تواند هر محیط بصری را از صفر تفسیر کند. یک توسعه‌دهنده تصمیم گرفت با بازسازی تنظیمات شرح داده شده در صفحه عرضه Anthropic و اجرای مدل روی نسخه چینی بازی، این ادعا را راستی‌آزمایی کند.

نحوه اجرای آزمایش

یک چارچوب (harness) سفارشی، فریم‌های ویدیویی خام را به مدل تزریق کرده و انتخاب‌های عملیاتی آن را ثبت می‌کرد. این چارچوب با توضیحات Anthropic مطابقت داشت؛ به این صورت که هر فریم جدید را به مدل می‌داد و ورودی انتخاب‌شده کنترلر را بازخوانی می‌کرد. آزمایش، چرخه کامل بازی را تا زمانی که مدل اولین نشان باشگاه خود را به دست آورد اجرا کرد و سپس تا نوبت ۲۰۰۰ ادامه یافت، یعنی زمانی که آواتار به Route 3 رسید.

نتیجه کمی مشخص بود:

  • کسب اولین نشان باشگاه پس از ۱۷۸۵ نوبت
  • هزینه کل محاسبات ۶۵.۴۰ دلار
  • تا نوبت ۲۰۰۰، آواتار در Route 3 بود

آنچه لاگ‌ها فاش می‌کنند

با این حال، لاگ‌های خام داستان متفاوتی را درباره نحوه رسیدن مدل به آن مرحله روایت می‌کنند. «زنجیره تفکر» داخلی مدل، مکرراً اطلاعاتی را یادداشت می‌کرد که هنوز در صفحه نمایش ظاهر نشده بودند.

  • در نوبت ۷۸، مدل خاطرنشان کرد که رقیب Charmander را انتخاب خواهد کرد، در حالی که بازی هنوز انتخاب رقیب را نمایش نداده بود.
  • ۱۴۱ نوبت بعد، زمانی که بازی در نهایت Oak’s Parcel را به بازیکن داد، مدل از قبل نام آیتم را در یادداشت‌های خود ثبت کرده بود.
  • هنگام عبور از Route 3، مدل یک مربی خاص را با نقل‌قول از یک دیالوگ معروف که هرگز در فید بصری ظاهر نشده بود، شناسایی کرد.

این ورودی‌ها محصول تحلیل پیکسل‌به‌پیکسل نیستند. آن‌ها نشانه‌های سیستمی هستند که یک سناریوی دقیق از بازی را درونی کرده است؛ دقیقاً همان نوع دانشی که در راهنماها (walkthroughs)، ویکی‌ها و ویدیوهای طرفداران در اینترنت یافت می‌شود. به عبارت دیگر، به نظر می‌رسد مدل از بینایی صرفاً برای تأیید نقشه‌ای استفاده می‌کند که از قبل از حفظ است.

چرا این موضوع برای بنچمارک‌های استدلال بصری اهمیت دارد

این آزمایش بر یک نقص ظریف اما حیاتی در بسیاری از تست‌های استدلال بصری تأکید می‌کند:

  • ورودی پاک، وضعیت دانش پاک را تضمین نمی‌کند. حتی زمانی که تنها کانال، یک جریان تصویری است، مدل ممکن است از مخزن عظیمی از حقایق حفظ‌شده استفاده کند.
  • پرامپت‌های سیستم نمی‌توانند داده‌های آموزشی را پاک کنند. مدلی که یک راهنمای کامل بازی را دیده است، بدون بازآموزی نمی‌توان آن را مجبور به «فراموش کردن» کرد.
  • عملکرد ممکن است حافظه را بسنجد، نه ادراک را. وقتی دنیای تست با یک مجموعه داده شناخته‌شده مطابقت دارد، مدل می‌تواند به جای تفسیر واقعی اطلاعات بصری جدید، با تطبیق الگو با الگو موفق شود.

اگر بنچمارک‌ها همچنان با «فقط بصری» به عنوان جایگزینی برای استدلال بصری برخورد کنند، این خطر وجود دارد که ادعاها درباره توانایی هوش مصنوعی در درک محیط‌های جدید را بیش از حد بزرگ جلوه دهند. شرکت‌ها می‌توانند اعداد خیره‌کننده‌ای را تبلیغ کنند، در حالی که مجموعه مهارت‌های زیربنایی همچنان محدود است؛ موضوعی که برای سرمایه‌گذاران، توسعه‌دهندگان و هر کسی که در حال ساخت سیستم‌های حساس به ایمنی است که باید در محیط‌های واقعاً دیده‌نشده عمل کنند، اهمیت دارد.

دیدگاه مقابل: آیا حفظ کردن واقعاً یک مشکل است؟

برخی استدلال می‌کنند که تأیید یک نقشه شناخته‌شده همچنان مستلزم نوعی استدلال است: مدل باید بازنمایی داخلی خود را با نشانه‌های بصری فعلی همسو کند. از این منظر، این دمو یک قابلیت مفید را نشان می‌دهد: استفاده از بینایی برای تثبیت یک پایگاه دانش از پیش موجود. این اعتراض وارد است؛ زیرا وظیفه مذکور شامل یک بررسی ادراکی نیز می‌شود.

با این حال، هدف اصلی بنچمارک، ارزیابی استنتاج بصری عمومی است، نه بازیابی یک سناریوی ذخیره‌شده. وقتی مدلی می‌تواند رویدادها را قبل از ظاهر شدن پیش‌بینی کند، آزمایش دیگر ادراک را ایزوله نمی‌کند. مرز بین تثبیت مفید و تقلب آشکار کمرنگ می‌شود و نتایج ارزش تشخیصی خود را از دست می‌دهند.

گام‌های بعدی و واکنش جامعه

برای بررسی محدودیت‌های حافظه، آزمایش‌گر اکنون همان مدل را روی نقشه‌ای تغییریافته با جغرافیای دگرگون‌شده اجرا می‌کند. تمام کدها، ابزار سفارشی (custom harness) و فایل‌های کامل لاگ به‌صورت عمومی در دسترس قرار گرفته‌اند تا سایر پژوهشگران را برای بازتولید این آزمایش یا به‌کارگیری آن در بازی‌های مختلف دعوت کنند. همچنین یک کانال گفتگو در یک پلتفرم انجمن یادگیری برای گفتگوهای مستمر ایجاد شده است.

نکته کلیدی

یک دموی صرفاً بینایی‌محور (vision-only demo) که صرفاً به این دلیل موفق می‌شود که مدل از قبل پاسخ را می‌داند، مدرکی بر استدلال بصری واقعی نیست. بنچمارک‌ها باید دانش حفظ‌شده را از ادراک آنی (on-the-fly perception) تفکیک کنند، در غیر این صورت ممکن است توانایی هوش مصنوعی در پیمایش در دنیای‌های بصری واقعاً ناشناخته را بیش از حد واقعی نشان دهند.