গত কয়েক বছর ছবি তৈরি করা এআই (AI) সিস্টেমের আধিপত্যে ছিল। কম চাকচিক্যময় হলেও, সম্ভবত আরও কঠিন চ্যালেঞ্জ হলো মেশিনকে যা দেখছে তা সত্যিকার অর্থে বুঝতে শেখানো। একটি ফটোরিয়ালিস্টিক (photorealistic) প্রতিকৃতি তৈরি করা চিত্তাকর্ষক হতে পারে, কিন্তু একটি এআই-কে সেই প্রতিকৃতির সতর্কবার্তা পড়া, ব্যাকগ্রাউন্ডের সাপেক্ষে বস্তুটি কোথায় অবস্থিত তা বলা এবং তারপর দৃশ্যটি সম্পর্কে একটি যৌক্তিক প্রশ্নের উত্তর দিতে বলা এখনও একটি সত্যিকারের কঠিন ইঞ্জিনিয়ারিং সমস্যা। একটি সাম্প্রতিক টেকনিক্যাল রিপোর্টে বিস্তারিত বর্ণিত নতুন একটি ভিশন-ল্যাঙ্গুয়েজ মডেল Qwen-Image একটি নির্দিষ্ট লক্ষ্য নিয়ে এই ক্ষেত্রে প্রবেশ করেছে: উপরিভাগের বর্ণনার ঊর্ধ্বে গিয়ে ভিজ্যুয়াল এবং টেক্সচুয়াল তথ্যকে একটি একক সমন্বিত প্রবাহ হিসেবে প্রসেস করা।
Qwen-Image যা ভিন্নভাবে করে
বেশিরভাগ পূর্ববর্তী ভিশন সিস্টেম একটি ছবির দিকে এমনভাবে তাকায় যেভাবে একজন সাধারণ দর্শক একটি পোস্টারের দিকে এক পলক তাকান। তারা মূল বিষয়টি শনাক্ত করে, একটি সাধারণ ক্যাপশন যুক্ত করে এবং চলে যায়। একটি ব্যস্ত রাস্তার মোড়ের ছবি কেবল "রাস্তায় গাড়ি এবং পথচারী" হিসেবে চিহ্নিত হয়। এই ধরণের আউটপুট ফটো অ্যালবাম সাজানোর জন্য উপযোগী, কিন্তু যখন আপনার সূক্ষ্মতার প্রয়োজন হয় তখন এটি দ্রুত অকার্যকর হয়ে পড়ে।
Qwen-Image আরও গভীরে যাওয়ার জন্য তৈরি করা হয়েছে। ইমেজ রিকগনিশন এবং ল্যাঙ্গুয়েজ আন্ডারস্ট্যান্ডিং-কে আলাদা আলাদা কাজ হিসেবে জোড়া না দিয়ে, এটি শুরু থেকেই ভিজ্যুয়াল ডেটা এবং টেক্সট একসাথে হ্যান্ডেল করে। এই সমন্বিত প্রসেসিংটি গুরুত্বপূর্ণ কারণ এটি মডেলটিকে দৃশ্যের একটি অস্পষ্ট ধারণা বা স্কেচের ওপর ভিত্তি করে অনুমান করার পরিবর্তে, যা সে আসলে দেখছে তার ওপর ভিত্তি করে ভাষাকে প্রতিষ্ঠিত করতে সাহায্য করে। যখন মডেলটি একটি ছবির ক্যাপশন দেয়, কোনো প্রশ্নের উত্তর দেয় বা একটি ছবিতে থাকা টেক্সট পড়ে, তখন এটি ভিজ্যুয়াল ইনপুটের একই শেয়ার্ড রিপ্রেজেন্টেশনের ওপর ভিত্তি করে কাজ করে।
নজর রাখার মতো চারটি সক্ষমতা
টেকনিক্যাল রিপোর্টটি চারটি নির্দিষ্ট শক্তির কথা তুলে ধরেছে যা Qwen-Image-কে কেবল বস্তুর নাম চিহ্নিত করা মডেলগুলো থেকে আলাদা করে।
উচ্চ-নির্ভুলতা সম্পন্ন ইমেজ ক্যাপশনিং। একটি কার্যকর ক্যাপশন কেবল বস্তুর তালিকার চেয়ে বেশি কিছু। এটি প্রেক্ষাপট, কাজ এবং সম্পর্কগুলো ফুটিয়ে তোলে। বাস্তবে, এর অর্থ হলো একজন শেফ সক্রিয়ভাবে সবজি কাটছেন এমন একটি ছবি এবং কাউন্টারে রাখা উপকরণের একটি স্থির ছবির মধ্যে পার্থক্য করা। কন্টেন্ট মডারেটর, অ্যাক্সেসিবিলিটি টুল বা স্বয়ংক্রিয় মেটাডেটা জেনারেটর তৈরি করা ডেভেলপারদের জন্য, বর্ণনামূলক সূক্ষ্মতার এই অতিরিক্ত স্তরটি ম্যানুয়াল রিভিউ করার সময় কমায় এবং ভুল হ্রাস করে।
ছবির ভেতরে শক্তিশালী টেক্সট রিকগনিশন। অনেক বাস্তব জগতের ভিজ্যুয়াল কাজের জন্য ছবিতে স্বাভাবিকভাবে আসা শব্দগুলো পড়া প্রয়োজন। অদ্ভুত কোণ থেকে তোলা দোকানের সাইনবোর্ড, এরর মেসেজের স্ক্রিনশট, হাতে লেখা নোট বা ফোন ক্যামেরায় তোলা প্রিন্ট করা ডকুমেন্টের কথা ভাবুন। একটি মডেল যা আলাদা কোনো OCR পাইপলাইনের প্রয়োজন ছাড়াই নির্ভরযোগ্যভাবে এই টেক্সটগুলো বের করতে এবং বুঝতে পারে, তা অ্যাপ্লিকেশন আর্কিটেকচারকে উল্লেখযোগ্যভাবে সহজ করে তোলে। ডেভেলপারদের আর একটি এক্সটার্নাল রিডার যুক্ত করার এবং দুটি সিস্টেম ছবিতে কী আছে সে বিষয়ে একমত হবে এমন আশা করার প্রয়োজন নেই।
ভিজ্যুয়াল প্রশ্নের জন্য উন্নত রিজনিং। যখন উত্তরটি সরাসরি দৃশ্যমান থাকে, যেমন "বলটির রঙ কী?", তখন একটি ছবি সম্পর্কে প্রশ্নের উত্তর দেওয়া সহজ। কঠিন প্রশ্নগুলোর জন্য যুক্তির প্রয়োজন: পরিমাণের তুলনা করা, একটি সিকোয়েন্সের পরিবর্তন ট্র্যাক করা বা চেহারা দেখে কাজ অনুমান করা। একজন রক্ষণাবেক্ষণ টেকনিশিয়ান জিজ্ঞাসা করতে পারেন যে একটি নির্দিষ্ট ক্যাপাসিটর সঠিকভাবে বসানো হয়েছে কি না, অথবা একজন ক্রেতা একটি ছবির ভিত্তিতে জিজ্ঞাসা করতে পারেন যে দুটি পণ্যের মধ্যে কোনটির এক্সপায়ারি ডেট ভালো। Qwen-Image এই জটিল ভিজ্যুয়াল কাজগুলো সেই মডেলগুলোর তুলনায় অনেক বেশি নির্ভুলতার সাথে সম্পন্ন করে যা কেবল ইমেজ রিজিয়নের সাথে কিওয়ার্ড মেলানোর কাজ করে।
স্থানিক সম্পর্কের উন্নত ধারণা। মানুষের দৃষ্টিশক্তি গভীরভাবে স্থানিক। আমরা তাৎক্ষণিকভাবে বুঝতে পারি যে কফি মগটি ল্যাপটপের ঢাকনার পেছনে আছে, অথবা সাইকেলটি বেড়া এবং কার্বের মাঝখানে রয়েছে। মেশিনগুলো প্রায়শই "বামে", "নিচে" বা "আংশিকভাবে ঢাকা" এর মতো বিষয়গুলোতে হিমশিম খায়, বিশেষ করে যখন দৃশ্যটি অগোছালো থাকে। শক্তিশালী স্পেশাল রিজনিং একটি ভিশন মডেলকে রোবোটিক্স নেভিগেশন, ওয়্যারহাউস ইনভেন্টরি সিস্টেম, অগমেন্টেড রিয়েলিটি ওভারলে এবং এমন যেকোনো অ্যাপ্লিকেশনের জন্য অনেক বেশি উপযোগী করে তোলে যেখানে বস্তুর ভৌত বিন্যাস অর্থবহ।
দেখা এবং বোঝার মধ্যকার ব্যবধান কমিয়ে আনা
র (raw) পিক্সেল রিকগনিশন এবং প্রকৃত উপলব্ধির মধ্যে অনেক ব্যবধান রয়েছে। একটি সিকিউরিটি ক্যামেরা ফোটন রেকর্ড করার মাধ্যমে একটি ওয়্যারহাউস ফ্লোর "দেখতে" পারে, কিন্তু একটি প্যালেট সরানো হয়েছে, একটি সতর্ক সংকেত এখন ঢাকা পড়েছে এবং একজন কর্মীর উচ্চতা সংক্রান্ত প্রশ্নের উত্তর নিকটতম র্যাকে থাকা লেবেলটি পড়ে দেওয়া সম্ভব—এই বিষয়গুলো বোঝার জন্য আরও উন্নত কিছু প্রয়োজন।
Qwen-Image-এর পেছনের গবেষকরা বিশেষভাবে সেই ব্যবধান পূরণের জন্য এটি ডিজাইন করেছেন। ভিশন এবং ল্যাঙ্গুয়েজ প্রসেসিংকে একত্রিত করার মাধ্যমে, মডেলটির লক্ষ্য হলো এমন একটি বাস্তবসম্মত বোঝাপড়া প্রদান করা যা কম্পিউটার ভিশনকে কেবল toy demonstrations-এর মধ্যে সীমাবদ্ধ না রেখে জটিল কাজের প্রবাহের (workflows) জন্য ব্যবহারিক করে তোলে।
ডেভেলপারদের জন্য কেন বেঞ্চমার্ক গুরুত্বপূর্ণ
বাছাই করা কিছু উদাহরণের মাধ্যমে একটি মডেলের ডেমো দেখানো এক কথা। কিন্তু এটিকে প্রোডাকশনে (production) ব্যবহার করা সম্পূর্ণ ভিন্ন বিষয়, যেখানে ব্যবহারকারীরা ঝাপসা, কম আলোযুক্ত এবং অদ্ভুতভাবে কম্পোজ করা ছবি আপলোড করেন। রিপোর্টে উল্লেখ করা হয়েছে যে, Qwen-Image স্ট্যান্ডার্ড বেঞ্চমার্কগুলোতে ভালো পারফর্ম করে। এই বেঞ্চমার্কগুলো গুরুত্বপূর্ণ কারণ এগুলো নিয়ন্ত্রিত অবস্থায় মডেলগুলোকে বিভিন্ন ধরণের ছবি, adversarial examples এবং বৈচিত্র্যময় প্রশ্নের ফরম্যাটের মুখোমুখি করে।
ডেভেলপারদের জন্য, শক্তিশালী বেঞ্চমার্ক পারফরম্যান্স মানে হলো প্রেডিক্টেবিলিটি (predictability)। এর মানে হলো আলো পরিবর্তন হলে, টেক্সট অপ্রত্যাশিত ফন্টে দেখা দিলে, অথবা ব্যবহারকারী এমন কোনো প্রশ্ন করলে যেখানে একাধিক ভিজ্যুয়াল তথ্যের সমন্বয় প্রয়োজন, তখন আকস্মিক ব্যর্থতার সম্ভাবনা কম থাকে। আপনি যখন কোনো কম্পিউটার ভিশন অ্যাপ্লিকেশনের জন্য একটি foundation model বেছে নিচ্ছেন, তখন সেই নির্ভরযোগ্যতা প্রায়শই চাকচিক্যময় ফিচারের চেয়ে বেশি গুরুত্বপূর্ণ হয়ে ওঠে।
আসল সারসংক্ষেপ
এমন মডেলের কোনো অভাব নেই যা একটি ছবি দেখে সে সম্পর্কে কিছু বলতে পারে। কার্যকর মডেল হলো সেগুলোই যা ফ্রেমের ভেতরের টেক্সট পড়তে পারে, জটিল প্রশ্নের মাধ্যমে যুক্তি প্রদান করতে পারে, স্পেশিয়াল লেআউট (spatial layouts) নির্ভুলভাবে বর্ণনা করতে পারে এবং এমন ক্যাপশন তৈরি করতে পারে যা প্রকৃতপক্ষে কী ঘটছে তা প্রতিফলিত করে। Qwen-Image দেখে মনে হয় এটি দ্বিতীয় ধরণের কাজের জন্যই তৈরি করা হয়েছে।
আপনি যদি কোনো প্রোডাকশন প্রজেক্টের জন্য vision-language মডেলগুলো মূল্যায়ন করতে চান, তবে পূর্ণাঙ্গ টেকনিক্যাল রিপোর্টে মেথডোলজি, ডেটাসেটের বিবরণ এবং পরীক্ষার ফলাফল রয়েছে যা একটি সঠিক তুলনার জন্য আপনার প্রয়োজন হবে। আপনি সম্পূর্ণ রিপোর্টটি এখানে পড়তে পারেন। আপনি যদি অন্যান্য নির্মাতা এবং গবেষকদের সাথে এই উন্নয়নগুলো নিয়ে আলোচনা করতে চান, তবে GyaanSetu learning community উন্মুক্ত রয়েছে।
