یک معلم در هند پس از انتشار ویدئویی از یک حادثه در کلاس درس در یک گروه چت، تعلیق شد و بینندگان درباره اینکه آیا این کلیپ واقعی است یا توسط هوش مصنوعی ساخته شده، بحث کردند. این هیاهو «سودِ دروغگو» (liar’s dividend) را برجسته میکند – یعنی روشی که در آن صرفِ وجود رسانههای مصنوعی به هر کسی اجازه میدهد به شواهد واقعی شک کند – و یک نقطه کور را در موج فعلی تشخیصدهندههای جعل عمیق (deep-fake) آشکار میسازد.
موردی که باعث ایجاد هشدار شد
با وایرال شدن ویدیو، بحثی موازی شکل گرفت: برخی کاربران به نقصهای آشکاری اشاره کردند که ممکن است نشاندهنده جعل عمیق باشد، در حالی که برخی دیگر معتقد بودند که صرفِ امکانِ دستکاری، هرگونه مدرک تصویری را غیرقابل اعتماد میکند.
چرا تشخیصدهندههای فعلی جعل عمیق ناتوان هستند
بیشتر راهکارهای ضد جعل عمیق به دنبال آثار بهجامانده از مدلهای مولد هستند – الگوهای پیکسلی عجیب، نورپردازی ناهماهنگ یا نشانههای صوتی نامتناسب. این نشانهها میتوانند منشأ مصنوعی را مشخص کنند، اما هیچ کمکی به تأیید اینکه چه کسی واقعاً در کادر حضور دارد نمیکنند. در یک دادگاه یا جلسه انضباطی، یک امتیاز احتمالی مبنی بر اینکه ویدیو «احتمالاً جعلی است»، مسئله هویت را حل نمیکند. تمرکز فعلی بر این پرسش که «آیا این ویدیو جعلی است؟»، زمانی که مسئله اصلی این است که «آ آیا این ویدیو همان شخصی را نشان میدهد که ادعا میکند؟»، شکافی ایجاد میکند.
نیاز به هویت بیومتریک قابل تأیید
محققان به روشی نیاز دارند تا با دقت ریاضی ثابت کنند چهرهای که در ویدیو دیده میشود متعلق به یک فرد مشخص است. خط لولههای (pipelines) مدرن بینایی ماشین، یک بردار ویژگی با ابعاد بالا – یعنی یک «embedding» – از هر چهره استخراج میکنند. با اندازهگیری فاصله اقلیدسی بین دو embedding، یک سیستم میزان شباهت چهرهها را تعیین میکند. فواصل کوچک نشاندهنده یک فرد واحد است؛ فواصل بزرگتر نشاندهنده فردی متفاوت است. این روش حتی زمانی که ویدیو دانهدانه (grainy) یا با نور ضعیف باشد نیز کار میکند، زیرا embeddingها ویژگیهای انتزاعی چهره را به جای مقادیر خام پیکسلها ثبت میکنند.
موانع عملی برای محققان
دو مانع باعث میشود تأیید بیومتریک برای بسیاری از کسانی که به آن نیاز دارند، دور از دسترس باشد. اول، ابزارهای در سطح سازمانی (enterprise-grade) که وعده دقت بالا میدهند، قیمتهایی دارند که تیمهای تحقیقاتی کوچک یا محققان مستقل توان پرداخت آن را ندارند. دوم، اپلیکیشنهای مصرفکننده (consumer-focused) دقت را فدای راحتی میکنند و نرخ مثبت کاذب (false-positive) بالایی دارند که در بررسیهای قانونی قابل دفاع نیست. ترکیب هزینه و نتایج غیرقابل اعتماد، محققان را مجبور میکند به مقایسههای بصری موردی (ad-hoc) تکیه کنند که بسیار دور از علم است.
ساخت ابزارهایی که در دادگاه قابل استناد باشند
توسعهدهندگانی که هدفشان پر کردن این شکاف است، باید از یک فلسفه طراحی سهمرحلهای پیروی کنند:
- اعتماد به نفس را نشان دهید، نه فقط یک پاسخ دوگانه. گزارش فاصله بین embeddingها و اجازه دادن به کاربران برای تعیین آستانههای خودشان. یک امتیاز شفاف به وکیل اجازه میدهد در صورت نیاز برای استانداردی سختگیرانهتر استدلال کند.
- منشأ فایل را تأیید کنید. بررسی متادیتا (metadata)، مقادیر هش (hash values) و URLهای منبع برای تشخیص دستکاری یا نسبت دادن اشتباه. کلاهبرداران اغلب ویدیوها را در زمینههای گمراهکننده قرار میدهند، بنابراین یک خط لوله (pipeline) باید منشأهای مشکوک را علامتگذاری کند.
- سرعت و بهرهوری منابع را در اولویت قرار دهید. مدلهای سبکوزن ساخته شده بر پایه کتابخانههای متنباز (open-source) میتوانند روی سختافزارهای معمولی اجرا شوند و این فناوری را بدون از دست دادن دقت ریاضی، برای محققان مستقل در دسترس قرار دهند.
فراتر از اعداد خام، خروجی باید شامل کمکهای بصری باشد: نقاط شاخص چهره (facial landmarks) که روی تصویر قرار گرفتهاند.
نکته کلیدی: نبرد واقعی فقط بر سر شناسایی ویدیوهای مصنوعی نیست؛ بلکه بر سر ارائه روشی با دقت ریاضی به محققان برای تأیید این است که چه کسی در صفحه نمایش دیده میشود. توسعهدهندگانی که از تشخیص جعل عمیق به سمت هویت بیومتریک قابل تأیید تغییر مسیر میدهند، به جلوگیری از نابودی زندگی یک فرد توسط یک ویدیوی وایرال کمک خواهند کرد.
