یک معلم در هند پس از انتشار ویدئویی از یک حادثه در کلاس درس در یک گروه چت، تعلیق شد و بینندگان درباره اینکه آیا این کلیپ واقعی است یا توسط هوش مصنوعی ساخته شده، بحث کردند. این هیاهو «سودِ دروغگو» (liar’s dividend) را برجسته می‌کند – یعنی روشی که در آن صرفِ وجود رسانه‌های مصنوعی به هر کسی اجازه می‌دهد به شواهد واقعی شک کند – و یک نقطه کور را در موج فعلی تشخیص‌دهنده‌های جعل عمیق (deep-fake) آشکار می‌سازد.

موردی که باعث ایجاد هشدار شد

با وایرال شدن ویدیو، بحثی موازی شکل گرفت: برخی کاربران به نقص‌های آشکاری اشاره کردند که ممکن است نشان‌دهنده جعل عمیق باشد، در حالی که برخی دیگر معتقد بودند که صرفِ امکانِ دستکاری، هرگونه مدرک تصویری را غیرقابل اعتماد می‌کند.

چرا تشخیص‌دهنده‌های فعلی جعل عمیق ناتوان هستند

بیشتر راهکارهای ضد جعل عمیق به دنبال آثار به‌جامانده از مدل‌های مولد هستند – الگوهای پیکسلی عجیب، نورپردازی ناهماهنگ یا نشانه‌های صوتی نامتناسب. این نشانه‌ها می‌توانند منشأ مصنوعی را مشخص کنند، اما هیچ کمکی به تأیید اینکه چه کسی واقعاً در کادر حضور دارد نمی‌کنند. در یک دادگاه یا جلسه انضباطی، یک امتیاز احتمالی مبنی بر اینکه ویدیو «احتمالاً جعلی است»، مسئله هویت را حل نمی‌کند. تمرکز فعلی بر این پرسش که «آیا این ویدیو جعلی است؟»، زمانی که مسئله اصلی این است که «آ آیا این ویدیو همان شخصی را نشان می‌دهد که ادعا می‌کند؟»، شکافی ایجاد می‌کند.

نیاز به هویت بیومتریک قابل تأیید

محققان به روشی نیاز دارند تا با دقت ریاضی ثابت کنند چهره‌ای که در ویدیو دیده می‌شود متعلق به یک فرد مشخص است. خط لوله‌های (pipelines) مدرن بینایی ماشین، یک بردار ویژگی با ابعاد بالا – یعنی یک «embedding» – از هر چهره استخراج می‌کنند. با اندازه‌گیری فاصله اقلیدسی بین دو embedding، یک سیستم میزان شباهت چهره‌ها را تعیین می‌کند. فواصل کوچک نشان‌دهنده یک فرد واحد است؛ فواصل بزرگتر نشان‌دهنده فردی متفاوت است. این روش حتی زمانی که ویدیو دانه‌دانه (grainy) یا با نور ضعیف باشد نیز کار می‌کند، زیرا embeddingها ویژگی‌های انتزاعی چهره را به جای مقادیر خام پیکسل‌ها ثبت می‌کنند.

موانع عملی برای محققان

دو مانع باعث می‌شود تأیید بیومتریک برای بسیاری از کسانی که به آن نیاز دارند، دور از دسترس باشد. اول، ابزارهای در سطح سازمانی (enterprise-grade) که وعده دقت بالا می‌دهند، قیمت‌هایی دارند که تیم‌های تحقیقاتی کوچک یا محققان مستقل توان پرداخت آن را ندارند. دوم، اپلیکیشن‌های مصرف‌کننده (consumer-focused) دقت را فدای راحتی می‌کنند و نرخ مثبت کاذب (false-positive) بالایی دارند که در بررسی‌های قانونی قابل دفاع نیست. ترکیب هزینه و نتایج غیرقابل اعتماد، محققان را مجبور می‌کند به مقایسه‌های بصری موردی (ad-hoc) تکیه کنند که بسیار دور از علم است.

ساخت ابزارهایی که در دادگاه قابل استناد باشند

توسعه‌دهندگانی که هدفشان پر کردن این شکاف است، باید از یک فلسفه طراحی سه‌مرحله‌ای پیروی کنند:

  • اعتماد به نفس را نشان دهید، نه فقط یک پاسخ دوگانه. گزارش فاصله بین embeddingها و اجازه دادن به کاربران برای تعیین آستانه‌های خودشان. یک امتیاز شفاف به وکیل اجازه می‌دهد در صورت نیاز برای استانداردی سخت‌گیرانه‌تر استدلال کند.
  • منشأ فایل را تأیید کنید. بررسی متادیتا (metadata)، مقادیر هش (hash values) و URLهای منبع برای تشخیص دستکاری یا نسبت دادن اشتباه. کلاهبرداران اغلب ویدیوها را در زمینه‌های گمراه‌کننده قرار می‌دهند، بنابراین یک خط لوله (pipeline) باید منشأهای مشکوک را علامت‌گذاری کند.
  • سرعت و بهره‌وری منابع را در اولویت قرار دهید. مدل‌های سبک‌وزن ساخته شده بر پایه کتابخانه‌های متن‌باز (open-source) می‌توانند روی سخت‌افزارهای معمولی اجرا شوند و این فناوری را بدون از دست دادن دقت ریاضی، برای محققان مستقل در دسترس قرار دهند.

فراتر از اعداد خام، خروجی باید شامل کمک‌های بصری باشد: نقاط شاخص چهره (facial landmarks) که روی تصویر قرار گرفته‌اند.

نکته کلیدی: نبرد واقعی فقط بر سر شناسایی ویدیوهای مصنوعی نیست؛ بلکه بر سر ارائه روشی با دقت ریاضی به محققان برای تأیید این است که چه کسی در صفحه نمایش دیده می‌شود. توسعه‌دهندگانی که از تشخیص جعل عمیق به سمت هویت بیومتریک قابل تأیید تغییر مسیر می‌دهند، به جلوگیری از نابودی زندگی یک فرد توسط یک ویدیوی وایرال کمک خواهند کرد.