مدل Fable 5 شرکت Anthropic توانست در ۱۷۸۵ نوبت و با صرف ۶۵.۴۰ دلار، اولین نشان باشگاه (gym badge) را در نسخه چینی بازی Pokémon FireRed، تنها با استفاده از خروجی بصری بازی، به دست آورد. این اجرا ثابت میکند که مدل میتواند بخش قابل شناسایی از بازی را بدون هیچ دستور متنی به پایان برساند، اما بررسی دقیق زنجیره تفکر (thinking chain) مدل نشان میدهد که آن به جای «دیدن» واقعی و استدلال درباره هر پیکسل، در حال بازگویی دانش حفظشده از بازی بوده است.
آزمون ادعای Anthropic
زمانی که Anthropic مدل Fable 5 را عرضه کرد، این شرکت بر یک دموی «فقط بصری» (vision-only) تأکید داشت که در آن مدل تنها با نگاه کردن به صفحه نمایش، در بازی Pokémon FireRed پیمایش میکرد. تیتر خبر طوری به نظر میرسید که گویی سیستم میتواند هر محیط بصری را از صفر تفسیر کند. یک توسعهدهنده تصمیم گرفت با بازسازی تنظیمات شرح داده شده در صفحه عرضه Anthropic و اجرای مدل روی نسخه چینی بازی، این ادعا را راستیآزمایی کند.
نحوه اجرای آزمایش
یک چارچوب (harness) سفارشی، فریمهای ویدیویی خام را به مدل تزریق کرده و انتخابهای عملیاتی آن را ثبت میکرد. این چارچوب با توضیحات Anthropic مطابقت داشت؛ به این صورت که هر فریم جدید را به مدل میداد و ورودی انتخابشده کنترلر را بازخوانی میکرد. آزمایش، چرخه کامل بازی را تا زمانی که مدل اولین نشان باشگاه خود را به دست آورد اجرا کرد و سپس تا نوبت ۲۰۰۰ ادامه یافت، یعنی زمانی که آواتار به Route 3 رسید.
نتیجه کمی مشخص بود:
- کسب اولین نشان باشگاه پس از ۱۷۸۵ نوبت
- هزینه کل محاسبات ۶۵.۴۰ دلار
- تا نوبت ۲۰۰۰، آواتار در Route 3 بود
آنچه لاگها فاش میکنند
با این حال، لاگهای خام داستان متفاوتی را درباره نحوه رسیدن مدل به آن مرحله روایت میکنند. «زنجیره تفکر» داخلی مدل، مکرراً اطلاعاتی را یادداشت میکرد که هنوز در صفحه نمایش ظاهر نشده بودند.
- در نوبت ۷۸، مدل خاطرنشان کرد که رقیب Charmander را انتخاب خواهد کرد، در حالی که بازی هنوز انتخاب رقیب را نمایش نداده بود.
- ۱۴۱ نوبت بعد، زمانی که بازی در نهایت Oak’s Parcel را به بازیکن داد، مدل از قبل نام آیتم را در یادداشتهای خود ثبت کرده بود.
- هنگام عبور از Route 3، مدل یک مربی خاص را با نقلقول از یک دیالوگ معروف که هرگز در فید بصری ظاهر نشده بود، شناسایی کرد.
این ورودیها محصول تحلیل پیکسلبهپیکسل نیستند. آنها نشانههای سیستمی هستند که یک سناریوی دقیق از بازی را درونی کرده است؛ دقیقاً همان نوع دانشی که در راهنماها (walkthroughs)، ویکیها و ویدیوهای طرفداران در اینترنت یافت میشود. به عبارت دیگر، به نظر میرسد مدل از بینایی صرفاً برای تأیید نقشهای استفاده میکند که از قبل از حفظ است.
چرا این موضوع برای بنچمارکهای استدلال بصری اهمیت دارد
این آزمایش بر یک نقص ظریف اما حیاتی در بسیاری از تستهای استدلال بصری تأکید میکند:
- ورودی پاک، وضعیت دانش پاک را تضمین نمیکند. حتی زمانی که تنها کانال، یک جریان تصویری است، مدل ممکن است از مخزن عظیمی از حقایق حفظشده استفاده کند.
- پرامپتهای سیستم نمیتوانند دادههای آموزشی را پاک کنند. مدلی که یک راهنمای کامل بازی را دیده است، بدون بازآموزی نمیتوان آن را مجبور به «فراموش کردن» کرد.
- عملکرد ممکن است حافظه را بسنجد، نه ادراک را. وقتی دنیای تست با یک مجموعه داده شناختهشده مطابقت دارد، مدل میتواند به جای تفسیر واقعی اطلاعات بصری جدید، با تطبیق الگو با الگو موفق شود.
اگر بنچمارکها همچنان با «فقط بصری» به عنوان جایگزینی برای استدلال بصری برخورد کنند، این خطر وجود دارد که ادعاها درباره توانایی هوش مصنوعی در درک محیطهای جدید را بیش از حد بزرگ جلوه دهند. شرکتها میتوانند اعداد خیرهکنندهای را تبلیغ کنند، در حالی که مجموعه مهارتهای زیربنایی همچنان محدود است؛ موضوعی که برای سرمایهگذاران، توسعهدهندگان و هر کسی که در حال ساخت سیستمهای حساس به ایمنی است که باید در محیطهای واقعاً دیدهنشده عمل کنند، اهمیت دارد.
دیدگاه مقابل: آیا حفظ کردن واقعاً یک مشکل است؟
برخی استدلال میکنند که تأیید یک نقشه شناختهشده همچنان مستلزم نوعی استدلال است: مدل باید بازنمایی داخلی خود را با نشانههای بصری فعلی همسو کند. از این منظر، این دمو یک قابلیت مفید را نشان میدهد: استفاده از بینایی برای تثبیت یک پایگاه دانش از پیش موجود. این اعتراض وارد است؛ زیرا وظیفه مذکور شامل یک بررسی ادراکی نیز میشود.
با این حال، هدف اصلی بنچمارک، ارزیابی استنتاج بصری عمومی است، نه بازیابی یک سناریوی ذخیرهشده. وقتی مدلی میتواند رویدادها را قبل از ظاهر شدن پیشبینی کند، آزمایش دیگر ادراک را ایزوله نمیکند. مرز بین تثبیت مفید و تقلب آشکار کمرنگ میشود و نتایج ارزش تشخیصی خود را از دست میدهند.
گامهای بعدی و واکنش جامعه
برای بررسی محدودیتهای حافظه، آزمایشگر اکنون همان مدل را روی نقشهای تغییریافته با جغرافیای دگرگونشده اجرا میکند. تمام کدها، ابزار سفارشی (custom harness) و فایلهای کامل لاگ بهصورت عمومی در دسترس قرار گرفتهاند تا سایر پژوهشگران را برای بازتولید این آزمایش یا بهکارگیری آن در بازیهای مختلف دعوت کنند. همچنین یک کانال گفتگو در یک پلتفرم انجمن یادگیری برای گفتگوهای مستمر ایجاد شده است.
نکته کلیدی
یک دموی صرفاً بیناییمحور (vision-only demo) که صرفاً به این دلیل موفق میشود که مدل از قبل پاسخ را میداند، مدرکی بر استدلال بصری واقعی نیست. بنچمارکها باید دانش حفظشده را از ادراک آنی (on-the-fly perception) تفکیک کنند، در غیر این صورت ممکن است توانایی هوش مصنوعی در پیمایش در دنیایهای بصری واقعاً ناشناخته را بیش از حد واقعی نشان دهند.
