ActiveVision বেঞ্চমার্ক দেখায় যে বর্তমানের শীর্ষস্থানীয় মাল্টিমোডাল লার্জ ল্যাঙ্গুয়েজ মডেলগুলো (LLMs) এমন ১০.৬% কাজ সমাধান করতে পেরেছে যেগুলোর জন্য একটি ছবির দিকে একাধিকবার তাকানো প্রয়োজন। ১৭টি ইটারেটিভ-পারসেপশন (iterative-perception) চ্যালেঞ্জের একটি পরীক্ষায়, মানুষ ৯৬.১% ক্ষেত্রে সফল হয়েছে যেখানে GPT-5.5 ১০.৬% এবং Claude Fable 5 ৩.৫% সফল হয়েছে; এগারটি কাজে মডেলগুলো থেকে একটিও সঠিক উত্তর পাওয়া যায়নি।

কেন বর্তমানের ভিশন মডেলগুলো হোঁচট খাচ্ছে

বেশিরভাগ ভিশন সিস্টেম একটি ছবিকে কেবল একবারের ইনপুট হিসেবে বিবেচনা করে। একটি “vision encoder” একবার ফিচারগুলো সংগ্রহ করে এবং তারপর যুক্তির (reasoning) জন্য সেগুলো ল্যাঙ্গুয়েজ মডেলের কাছে হস্তান্তর করে। এই পাইপলাইনটি দ্বিতীয়বার দেখার জন্য অনুরোধ করতে পারে না, কোনো নির্দিষ্ট অঞ্চলে জুম করতে পারে না, অথবা কোনো হাইপোথিসিস পুনরায় মূল্যায়ন করতে পারে না। বিপরীতে, মানুষ একটি প্রাথমিক ধারণা তৈরি করে, মনোযোগ পরিবর্তন করে, নতুন প্রমাণ সংগ্রহ করে এবং তাদের উত্তর সংশোধন করে। এই বেঞ্চমার্কটি সেই লুপটিকে একটি আনুষ্ঠানিক রূপ দেয়: প্রতিটি কাজ একটি মডেলকে পর্যবেক্ষণ করতে, একটি পদক্ষেপ প্রস্তাব করতে, ফলাফল পর্যবেক্ষণ করতে এবং সঠিক সিদ্ধান্তে না পৌঁছানো পর্যন্ত এটি পুনরাবৃত্তি করতে বাধ্য করে।

বেঞ্চমার্কটি কী পরীক্ষা করেছে

গবেষকরা ১৭টি এমন পরিস্থিতি তৈরি করেছেন যেগুলোর জন্য বারবার পর্যবেক্ষণের প্রয়োজন। ফলাফলগুলো অত্যন্ত স্পষ্ট:

  • মানব অংশগ্রহণকারী: ৯৬.১% সাফল্য
  • GPT-5.5: ১০.৬% সাফল্য
  • Claude Fable 5: ৩.৫% সাফল্য
  • এগারটি কাজ: প্রতিটি পরীক্ষিত মডেলের স্কোর ছিল শূন্য

এমনকি মডেলগুলো যখন ছবিটিকে পুনরায় প্রসেস করার জন্য কোড তৈরি করেছিল, তখনও তারা তাদের নিজস্ব আউটপুটের ভুলগুলো ধরতে পারেনি, যা নিশ্চিত করে যে এই সীমাবদ্ধতাটি ডেটা-চালিত হওয়ার চেয়ে স্থাপত্যগত (architectural)।

ডেভেলপার এবং শিল্পের জন্য ঝুঁকি

আপনি যদি স্বায়ত্তশাসিত রোবট, পরিদর্শন ড্রোন বা এমন কোনো সিস্টেম তৈরি করেন যা সময়ের সাথে সাথে ভিজ্যুয়াল তথ্য যাচাই করতে হয়, তবে একটি সিঙ্গেল-শট (single-shot) ভিশন মডেল ব্যবহার করা ঝুঁকিপূর্ণ। বেঞ্চমার্কটি দেখায় যে বর্তমান LLM-ভিত্তিক ভিশন পাইপলাইনগুলো ফিডব্যাক-চালিত পারসেপশন নির্ভরযোগ্যভাবে পরিচালনা করতে পারে না, তাই তারা ত্রুটি মিস করতে পারে, জিনিসের সংখ্যা ভুল গণনা করতে পারে বা গতিশীল দৃশ্যগুলো ভুলভাবে ব্যাখ্যা করতে পারে। আরও ট্রেনিং ডেটা যোগ করা বা প্যারামিটার বাড়ানো এই ব্যবধান দূর করবে না; এখানে যা প্রয়োজন তা হলো নিয়ন্ত্রিত এবং ইটারেটিভ পর্যবেক্ষণের একটি প্রক্রিয়া।

পাল্টা যুক্তি: বড় মডেলগুলো কি সাহায্য করতে পারে?

আরও ট্রেনিং ডেটা যোগ করা বা প্যারামিটার বাড়ানো এই ব্যবধান দূর করবে না; এখানে যা প্রয়োজন তা হলো নিয়ন্ত্রিত এবং ইটারেটিভ পর্যবেক্ষণের একটি প্রক্রিয়া।

সামনের পথ

গবেষকরা একটি পরিপূরক দিকের পরামর্শ দিয়েছেন:

  • আর্কিটেকচারাল রিডিজাইন (Architectural redesign) – একটি নিয়ন্ত্রণযোগ্য ভিজ্যুয়াল মডিউল যুক্ত করা যা মডেলের অভ্যন্তরীণ অবস্থার উপর ভিত্তি করে নতুন ভিউ অনুরোধ করতে পারে, অঞ্চল ক্রপ করতে পারে বা আলোর অবস্থা পরিবর্তন করতে পারে।

সারকথা: বর্তমান মাল্টিমোডাল LLM-গুলো স্থির ছবির প্রশ্নের উত্তর দিতে পারদর্শী হলেও যখন কোনো সমস্যার জন্য পুনরায় দেখার প্রয়োজন হয় তখন তারা ব্যর্থ হয়। প্রকৃত ভিজ্যুয়াল ইন্টেলিজেন্সের জন্য এমন মডেল প্রয়োজন যা কেবল একবার ছবি পড়বে না, বরং নিজের দৃষ্টি নিয়ন্ত্রণ করতে পারবে।