ভারতের একজন শিক্ষককে সাময়িক বরখাস্ত করা হয়েছে একটি ক্লাসরুমের ঘটনার ভিডিও গ্রুপ চ্যাটের মাধ্যমে ছড়িয়ে পড়ার পর, এবং দর্শকরা বিতর্ক করছেন যে ক্লিপটি আসল নাকি এআই-জেনারেটেড (AI-generated)। এই হট্টগোল “liar’s dividend” বিষয়টি তুলে ধরে – যেখানে সিন্থেটিক মিডিয়ার অস্তিত্ব থাকলেই যে কেউ আসল প্রমাণের ওপর সন্দেহ প্রকাশ করতে পারে – এবং এটি বর্তমান ডিপ-ফেক ডিটেক্টরগুলোর একটি সীমাবদ্ধতা বা অন্ধস্থান (blind spot) প্রকাশ করে।
যে ঘটনাটি সতর্কতা জাগিয়ে তুলেছে
ফুটেজটি ভাইরাল হওয়ার সাথে সাথে একটি সমান্তরাল বিতর্ক শুরু হয়: কিছু ব্যবহারকারী ডিপ-ফেক শনাক্ত করার মতো কিছু লক্ষণ বা ত্রুটি (glitches) নির্দেশ করেন, অন্যদিকে অন্যরা বলেন যে কারচুপির সম্ভাবনা থাকায় যেকোনো ভিজ্যুয়াল প্রমাণই এখন অনির্ভরযোগ্য।
কেন বিদ্যমান ডিপ-ফেক ডিটেক্টরগুলো যথেষ্ট নয়
বেশিরভাগ অ্যান্টি-ডিপ-ফেক সমাধান জেনারেটিভ মডেল দ্বারা রেখে যাওয়া আর্টিফ্যাক্ট বা চিহ্নগুলো খোঁজে – যেমন অদ্ভুত পিক্সেল প্যাটার্ন, অসামঞ্জস্যপূর্ণ আলো, বা অমিল থাকা অডিও সংকেত। এই সূত্রগুলো একটি সিন্থেটিক উৎস শনাক্ত করতে পারে, কিন্তু ফ্রেমের মধ্যে আসলে কে উপস্থিত তা নিশ্চিত করতে পারে না। একটি আদালত বা বিভাগীয় শুনানিতে, একটি ভিডিও "সম্ভবত নকল" হওয়ার যে সম্ভাব্যতা স্কোর (probability score) দেওয়া হয়, তা পরিচয়ের প্রশ্নটি সমাধান করতে পারে না। বর্তমানের মূল ফোকাস "এই ভিডিওটি কি নকল?" এর ওপর, যা একটি শূন্যস্থান তৈরি করে যখন আসল সমস্যাটি হলো "এই ভিডিওতে কি সেই ব্যক্তিকেই দেখানো হচ্ছে যাকে দেখানোর দাবি করা হচ্ছে?"
যাচাইযোগ্য বায়োমেট্রিক পরিচয়ের প্রয়োজনীয়তা
তদন্তকারীদের গাণিতিক নির্ভুলতার সাথে এটি প্রমাণ করার প্রয়োজন আছে যে, ভিডিওতে থাকা মুখটি একটি নির্দিষ্ট ব্যক্তির। আধুনিক কম্পিউটার-ভিশন পাইপলাইন প্রতিটি মুখ থেকে একটি উচ্চ-মাত্রিক ফিচার ভেক্টর – একটি “embedding” – সংগ্রহ করে। দুটি এমবেডিংয়ের মধ্যে ইউক্লিডীয় দূরত্ব (Euclidean distance) পরিমাপের মাধ্যমে একটি সিস্টেম মুখ দুটি কতটা সদৃশ তা নির্ধারণ করতে পারে। কম দূরত্ব একই ব্যক্তিকে নির্দেশ করে; বেশি দূরত্ব ভিন্ন ব্যক্তিকে নির্দেশ করে। ফুটেজটি ঝাপসা বা কম আলোতেও এটি কাজ করে, কারণ এমবেডিংগুলো র-পিক্সেল ভ্যালুর পরিবর্তে বিমূর্ত মুখমণ্ডলের বৈশিষ্ট্যগুলো সংগ্রহ করে।
তদন্তকারীদের জন্য ব্যবহারিক বাধাগুলো
দুটি বাধা বায়োমেট্রিক যাচাইকরণকে তাদের নাগালের বাইরে রাখে যাদের এটি প্রয়োজন। প্রথমত, উচ্চ নির্ভুলতার প্রতিশ্রুতি দেওয়া এন্টারপ্রাইজ-গ্রেড টুলগুলোর দাম এত বেশি যে ছোট গবেষণা দল বা স্বতন্ত্র তদন্তকারীরা তা বহন করতে পারে না। দ্বিতীয়ত, ভোক্তা-কেন্দ্রিক অ্যাপগুলো সুবিধার জন্য নির্ভুলতার সাথে আপস করে, যার ফলে উচ্চ ফলস-পজিটিভ (false-positive) রেট তৈরি হয় যা আইনি পর্যালোচনার ক্ষেত্রে টিকবে না। খরচ এবং অনির্ভরযোগ্য ফলাফলের এই সংমিশ্রণ তদন্তকারীদের অ্যাড-হক (ad-hoc) ভিজ্যুয়াল তুলনার ওপর নির্ভর করতে বাধ্য করে, যা বৈজ্ঞানিক পদ্ধতির থেকে অনেক দূরে।
আদালতে গ্রহণযোগ্য টুল তৈরি করা
ডেভেলপাররা যারা এই শূন্যস্থান পূরণ করতে চান, তাদের একটি তিন-ধাপের ডিজাইন দর্শন অনুসরণ করা উচিত:
- শুধুমাত্র বাইনারি উত্তর নয়, বরং আত্মবিশ্বাস দেখান। এমবেডিংয়ের মধ্যে দূরত্ব রিপোর্ট করুন এবং ব্যবহারকারীদের নিজস্ব থ্রেশহোল্ড (threshold) সেট করতে দিন। একটি স্বচ্ছ স্কোর আইনজীবীকে প্রয়োজনে আরও কঠোর মানদণ্ডের পক্ষে যুক্তি দিতে সাহায্য করে।
- ফাইলের উৎস যাচাই করুন। কারচুপি বা ভুল তথ্য শনাক্ত করতে মেটাডেটা, হ্যাশ ভ্যালু এবং সোর্স ইউআরএল (source URL) পরীক্ষা করুন। প্রতারকরা প্রায়ই বিভ্রান্তিকর প্রেক্ষাপটে ভিডিও ব্যবহার করে, তাই একটি পাইপলাইনকে অবশ্যই সন্দেহজনক উৎস শনাক্ত করতে হবে।
- গতি এবং রিসোর্স দক্ষতার ওপর অগ্রাধিকার দিন। ওপেন-সোর্স লাইব্রেরির ওপর তৈরি হালকা ওজনের (light-weight) মডেলগুলো সাধারণ হার্ডওয়্যারে চলতে পারে, যা গাণিতিক নির্ভুলতা বজায় রেখে প্রযুক্তিটিকে একক তদন্তকারীদের জন্য সহজলভ্য করে তোলে।
শুধুমাত্র সংখ্যা নয়, আউটপুটে ভিজ্যুয়াল এইড বা দৃশ্যমান সহায়ক উপাদান থাকা উচিত: যেমন ওভারলে করা ফেসিয়াল ল্যান্ডমার্ক (facial landmarks)।
মূল কথা: আসল লড়াই কেবল সিন্থেটিক ভিডিও শনাক্ত করার নয়; এটি তদন্তকারীদের স্ক্রিনে কে আছে তা নিশ্চিত করার জন্য একটি গাণিতিকভাবে সঠিক পদ্ধতি প্রদান করার বিষয়ে। যে ডেভেলপাররা ডিপ-ফেক ডিটেকশন থেকে সরে এসে যাচাইযোগ্য বায়োমেট্রিক পরিচয়ের দিকে মনোযোগ দেবেন, তারা একটি মাত্র ভাইরাল ক্লিপের কারণে কারো জীবন ধ্বংস হওয়া রোধ করতে সাহায্য করবেন।
