Anthropic کے Fable 5 ماڈل نے صرف گیم کے بصری آؤٹ پٹ (visual output) کا استعمال کرتے ہوئے، Pokémon FireRed کے چینی زبان والے ورژن کو کھیلتے ہوئے، 1,785 ٹرنز میں پہلا جم بیج (gym badge) حاصل کر لیا اور اس پر $65.40 خرچ ہوئے۔ یہ تجربہ ثابت کرتا ہے کہ ماڈل کسی بھی تحریری اشارے (textual prompt) کے بغیر گیم کے ایک پہچانے جانے والے حصے کو مکمل کر سکتا ہے، لیکن ماڈل کی "سوچنے کی زنجیر" (thinking chain) کا گہرا جائزہ لینے سے معلوم ہوتا ہے کہ وہ ہر پکسل کو حقیقت میں "دیکھنے" اور اس کے بارے میں استدلال کرنے کے بجائے، گیم کے یاد شدہ علم کو دہرا رہا تھا۔

Anthropic کے دعوے کا امتحان

جب Anthropic نے Fable 5 ریلیز کیا، تو کمپنی نے ایک "صرف بصری" (vision-only) ڈیمو کی اہمیت پر زور دیا جس میں ماڈل نے صرف اسکرین کو دیکھ کر Pokémon FireRed میں راستہ تلاش کیا۔ سرخیوں سے ایسا محسوس ہوتا تھا جیسے یہ سسٹم کسی بھی بصری ماحول کی بالکل شروع سے تشریح کر سکتا ہے۔ ایک ڈویلپر نے Anthropic کے لانچ پیج پر بیان کردہ سیٹ اپ کو دوبارہ تخلیق کر کے اور گیم کے چینی ترجمے پر ماڈل چلا کر اس دعوے کی تصدیق کرنے کا فیصلہ کیا۔

تجربہ کیسے کیا گیا

ایک کسٹم ہارس (custom harness) نے ماڈل کو خام ویڈیو فریمز فراہم کیے اور اس کےشنز (action choices) کو ریکارڈ کیا۔ یہ ہارس Anthropic کی تفصیلات کے مطابق تھا، جو ہر نئے فریم کو ماڈل تک پہنچاتا اور منتخب کردہ کنٹرولر ان پٹ کو پڑھتا۔ ٹیسٹ گیم کے مکمل لوپ کو اس وقت تک چلاتا رہا جب تک ماڈل نے اپنا پہلا جم بیج حاصل نہیں کر لیا، اور پھر اسے 2,000ویں ٹرن تک جاری رکھا گیا، جب اوتار Route 3 پر پہنچ گیا۔

مقداری نتیجہ واضح تھا:

  • 1,785 ٹرنز کے بعد پہلا جم بیج حاصل کیا گیا
  • کل کمپیوٹ لاگت $65.40
  • 2,000ویں ٹرن تک اوتار Route 3 پر تھا

لاگز کیا ظاہر کرتے ہیں

تاہم، خام لاگز اس بارے میں ایک مختلف کہانی سناتے ہیں کہ ماڈل وہاں کیسے پہنچا۔ ماڈل کی اندرونی "سوچنے کی زنجیر" (thinking chain) بار بار ایسی معلومات لکھتی رہی جو ابھی تک اسکرین پر ظاہر نہیں ہوئی تھیں۔

  • 78ویں ٹرن پر ماڈل نے نوٹ کیا کہ حریف Charmander کا انتخاب کرے گا، باوجود اس کے کہ گیم نے ابھی تک حریف کا انتخاب ظاہر نہیں کیا تھا۔
  • 141 ٹرنز بعد، جب گیم نے آخر کار کھلاڑی کو Oak’s Parcel دیا، تو ماڈل پہلے ہی اس آئٹم کا نام اپنے نوٹس میں ریکارڈ کر چکا تھا۔
  • Route 3 سے گزرتے ہوئے، ماڈل نے مکالمے کا ایک مشہور جملہ دہرا کر ایک مخصوص ٹرینر کی شناخت کی جو بصری فیڈ (visual feed) میں کبھی ظاہر نہیں ہوا تھا۔

یہ اندراجات پکسل بہ پکسل تجزیے کا نتیجہ نہیں ہیں۔ یہ ایک ایسے سسٹم کی نشانیاں ہیں جس نے گیم کے ایک تفصیلی اسکرپٹ کو اپنے اندر جذب کر لیا ہے—بالکل اسی طرح کا علم جو انٹرنیٹ پر موجود واک تھرو (walkthroughs)، وکیز (wikis) اور فین ویڈیوز میں پایا جاتا ہے۔ دوسرے لفظوں میں، ایسا لگتا ہے کہ ماڈل بصارت (vision) کو محض اس نقشے کی تصدیق کے لیے استعمال کر رہا ہے جسے وہ پہلے ہی زبانی جانتا ہے۔

بصری استدلال کے بینچ مارکس (visual-reasoning benchmarks) کے لیے یہ کیوں اہم ہے

یہ تجربہ بہت سے بصری استدلال کے ٹیسٹوں میں ایک باریک لیکن اہم خامی کو اجاگر کرتا ہے:

  • صاف ستھرا ان پٹ علم کی شفاف حالت کی ضمانت نہیں دیتا۔ اگرچہ واحد ذریعہ صرف ایک امیج اسٹریم ہو، پھر بھی ماڈل یاد شدہ حقائق کے ایک وسیع ذخیرے سے مدد لے سکتا ہے۔
  • سسٹم پرامپٹس ٹریننگ ڈیٹا کو ختم نہیں کر سکتے۔ ایک ایسا ماڈل جس نے مکمل واک تھرو دیکھا ہو، اسے دوبارہ ٹرین کیے بغیر "بھولنے" پر مجبور نہیں کیا جا سکتا۔
  • کارکردگی یادداشت کی پیمائش کر سکتی ہے، ادراک (perception) کی نہیں۔ جب ٹیسٹ کا ماحول کسی معلوم ڈیٹا سیٹ سے مطابقت رکھتا ہو، تو ماڈل نئی بصری معلومات کی اصل میں تشریح کرنے کے بجائے پیٹرن کو پیٹرن سے ملا کر کامیاب ہو سکتا ہے۔

اگر بینچ مارکس "صرف بصری" (vision-only) کو بصری استدلال کے متبادل کے طور پر استعمال کرتے رہے، تو اس سے نئے ماحول کو سمجھنے کی AI کی صلاحیت کے بارے میں دعووں کے بڑھا چڑھا کر پیش ہونے کا خطرہ ہے۔ کمپنیاں متاثر کن اعداد و شمار کا ڈھنڈورا پیٹ سکتی ہیں جبکہ بنیادی مہارت محدود رہے گی—یہ ایک ایسا مسئلہ ہے جو سرمایہ کاروں، ڈویلپرز اور ان تمام لوگوں کے لیے اہم ہے جو سیفٹی کے لحاظ سے حساس (safety-critical) سسٹمز بنا رہے ہیں جنہیں حقیقی معنوں میں غیر دیکھے ہوئے ماحول میں کام کرنا ہوتا ہے۔

جوابی نکتہ: کیا یادداشت واقعی ایک مسئلہ ہے؟

کچھ لوگوں کا کہنا ہے کہ ایک معلوم نقشے کی تصدیق کے لیے اب بھی ایک قسم کے استدلال کی ضرورت ہوتی ہے: ماڈل کو اپنی اندرونی نمائندگی کو موجودہ بصری اشارے کے ساتھ ہم آہنگ کرنا چاہیے۔ اس نقطہ نظر سے، ڈیمو ایک مفید صلاحیت کا مظاہرہ کرتا ہے—یعنی پہلے سے موجود علمی بنیاد کو مستحکم کرنے کے لیے بصارت کا استعمال کرنا۔ اعتراض درست ہے؛ اس کام میں ادراکی جانچ (perceptual check) شامل ہے۔

تاہم، بنیادی بینچ مارک کا مقصد عمومی بصری استدلال (general visual inference) کا جائزہ لینا ہے، نہ کہ محفوظ شدہ اسکرپٹ کی واپسی کا۔ جب ایک ماڈل واقعات کے ظاہر ہونے سے پہلے ہی ان کی پیش گوئی کر سکتا ہے، تو ٹیسٹ اب ادراک کو الگ تھلگ نہیں کر پاتا۔ مفید بنیاد فراہم کرنے اور کھلی دھوکہ دہی کے درمیان لکیر دھندلی ہو جاتی ہے، اور نتائج اپنی تشخیصی اہمیت کھو دیتے ہیں۔

اگلے اقدامات اور کمیونٹی کا ردعمل

یادداشت کی حدود کو جانچنے کے لیے، ٹیسٹر اب تبدیل شدہ جغرافیہ والے ایک ترمیم شدہ نقشے پر وہی ماڈل چلا رہا ہے۔ تمام کوڈ، کسٹم ہارنس، اور مکمل لاگ فائلیں عوامی طور پر دستیاب کر دی گئی ہیں، تاکہ دیگر محققین اس تجربے کو دہرانے یا اسے مختلف گیمز پر لاگو کرنے کی دعوت دے سکیں۔ مسلسل مکالمے کے لیے لرننگ کمیونٹی پلیٹ فارم پر ایک بحث کا چینل بھی کھول دیا گیا ہے۔

اہم نکتہ

صرف بصری (vision-only) ڈیمو جو اس لیے کامیاب ہوتا ہے کیونکہ ماڈل پہلے سے ہی جواب جانتا ہے، وہ حقیقی بصری استدلال کا ثبوت نہیں ہے۔ بینچ مارکس کو یاد شدہ علم اور فوری ادراک (on-the-fly perception) کے درمیان فرق کرنا چاہیے، ورنہ ان میں مصنوعی ذہانت (AI) کی حقیقت میں نامعلوم بصری دنیاؤں میں راستہ تلاش کرنے کی صلاحیت کو بڑھا چڑھا کر پیش کرنے کا خطرہ ہے۔