ভিশন-ল্যাঙ্গুয়েজ মডেলগুলো (VLMs) এখনও প্রাথমিক ভিজ্যুয়াল বা দৃশ্যমান কাজে কাঙ্ক্ষিত সাফল্য পাচ্ছে না। একটি নতুন PerceptionBench মূল্যায়ন থেকে দেখা গেছে যে, শীর্ষস্থানীয় ষোলোটি সিস্টেমের কোনোটিই সামগ্রিকভাবে ৬০% নির্ভুলতা অতিক্রম করতে পারেনি এবং এমনকি সবচেয়ে শক্তিশালী মডেলটিও কোনো একক দক্ষতায় ৮০%-এর নিচে রয়েছে। এই ফলাফলটি ডেভেলপারদের সতর্ক করে দিচ্ছে যে, জনপ্রিয় ক্যাপশনিং বা রিজনিং টেস্টে উচ্চ স্কোর মানেই নির্ভরযোগ্য দৃষ্টিশক্তি নিশ্চিত নয়।

কেন বিদ্যমান পরীক্ষাগুলো সমস্যাটি আড়াল করে রাখে

বেশিরভাগ পাবলিক বেঞ্চমার্ক ইমেজ ডেসক্রিপশন, প্রশ্নোত্তর এবং কমনসেন্স রিজনিং মিশিয়ে ফেলে। যখন একটি মডেল ভুল ক্যাপশন দেয়, তখন সেই ভুলটি ভাষার ত্রুটি, যুক্তির ভুল বা কোনো বস্তুকে চিনতে না পারার কারণে হতে পারে। যেহেতু এই তিনটি উপাদান একে অপরের সাথে মিশে থাকে, তাই একটি খারাপ স্কোর ভিজ্যুয়াল বা দৃশ্যমান ঘাটতি সম্পর্কে কোনো স্পষ্ট ধারণা দেয় না। ফলে অ্যাপ্লিকেশন তৈরির দলগুলো শিরোনামের সংখ্যা দেখে অতিরিক্ত আত্মবিশ্বাসী হয়ে ওঠে এবং ধরে নেয় যে মডেলটি সঠিকভাবে "দেখতে" পাচ্ছে।

PerceptionBench যা ভিন্নভাবে করে

PerceptionBench দশটি ভিজ্যুয়াল ক্ষমতাকে আলাদা করে এবং প্রতিটি মডেলকে একটি বিশুদ্ধ-ভিশন (pure-vision) টাস্ক সেটের মাধ্যমে মূল্যায়ন করে। ভাষা এবং রিজনিং বাদ দিয়ে এই বেঞ্চমার্কটি দেখায় যে ভিজ্যুয়াল ফ্রন্ট-এন্ডটি নিজে কতটা কার্যকর। সামগ্রিকভাবে, শীর্ষ ষোলোটি VLM ৬০% নির্ভুলতার সীমা অতিক্রম করতে পারেনি এবং সেরা পারফর্মিং সিস্টেমটিও কোনো একক দক্ষতায় ৮০%-এ পৌঁছাতে পারেনি। হ্যালুসিনেশন (Hallucination)—অর্থাৎ ছবিতে নেই এমন ডিটেইলস বা তথ্য তৈরি করা—হলো সবচেয়ে সাধারণ ভুল, যেখানে মডেলগুলোর শক্তি ও দুর্বলতার ধরন একেকটির ক্ষেত্রে একেক রকম।

কাদের ক্ষতি হতে পারে

ডেভেলপারদের ডেডিকেটেড ভিজ্যুয়াল ক্লাসিফায়ারগুলোকে সাধারণ AI মডেল দিয়ে প্রতিস্থাপন করা উচিত নয়।

যেখানে যুক্তিটি দুর্বল হয়ে পড়ে

PerceptionBench-এর তথ্যটি ক্রমহ্রাসমান রিটার্ন (diminishing returns) নির্দেশ করে: এমনকি সবচেয়ে বড় মডেলগুলোও এখনও মৌলিক পারসেপশন বা উপলব্ধি সংক্রান্ত কাজে হোঁচট খাচ্ছে।

ডেভেলপারদের জন্য ব্যবহারিক পদক্ষেপ

  • ডেডিকেটেড ভিজ্যুয়াল ক্লাসিফায়ার রাখুন সেই সব কাজের জন্য যেখানে সূক্ষ্মতার প্রয়োজন; VLM-গুলোকে প্রতিস্থাপনের পরিবর্তে পরিপূরক হিসেবে বিবেচনা করুন।
  • একটি ভেরিফিকেশন লেয়ার যোগ করুন যা ব্যবহারকারীর কাছে পৌঁছানোর আগে একটি বিশ্বস্ত ডিটেক্টরের মাধ্যমে মডেলের আউটপুট ক্রস-চেক করবে।
  • একটি লাইটওয়েট ভিশন ফিল্টার ব্যবহার করুন যাতে পাইপলাইনের শুরুতেই স্পষ্ট হ্যালুসিনেশন বা ভুল ক্লাসিফিকেশন ধরা পড়ে।

একটি সাধারণ-উদ্দেশ্যমূলক VLM-এর সাথে একটি নির্দিষ্ট কাজের জন্য তৈরি ভিশন কম্পোনেন্ট যুক্ত করলে, দলগুলো মডেলটির রিজনিং ক্ষমতা ব্যবহার করতে পারে এবং একই সাথে এর ভিজ্যুয়াল অন্ধবিন্দু (blind spots) থেকে সুরক্ষা পেতে পারে।

উৎস: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1