Вчителя в Індії відсторонили від роботи після того, як відео інциденту в класі поширилося через груповий чат, а глядачі почали сперечатися, чи є цей ролик справжнім, чи створеним штучним інтелектом. Цей резонанс підсвічує проблему «дивіденду брехуна» (liar’s dividend) — ситуацію, коли сама наявність синтетичних медіа дозволяє будь-кому ставити під сумнів реальні докази, — і виявляє «сліпу пляму» в сучасній хвилі детекторів дипфейків.
Випадок, що викликав тривогу
Коли відео стало вірусним, спалахнула паралельна дискусія: одні користувачі вказували на характерні помилки, які могли б видати дипфейк, тоді як інші стверджували, що сама можливість маніпуляції робить будь-які візуальні докази ненадійними.
Чому існуючі детектори дипфейків не справляються
Більшість рішень для боротьби з дипфейками шукають артефакти, залишені генеративними моделями: дивні піксельні патерни, невідповідне освітлення або розбіжності в аудіосигналах. Ці ознаки можуть вказати на синтетичне походження, але вони ніяк не підтверджують, хто саме з'являється в кадрі. У суді або на дисциплінарному слуханні показник імовірності того, що відео «ймовірно є фейком», не вирішує питання ідентифікації. Нинішній акцент на питанні «чи є це відео фейком?» створює прогалину, коли справжнє питання полягає в тому: «чи справді на цьому відео зображена та людина, за яку її видають?»
Необхідність верифікованої біометричної ідентифікації
Слідчим потрібен спосіб математично точно довести, що обличчя на відео належить конкретній особі. Сучасні конвеєри комп'ютерного зору витягують із кожного обличчя багатовимірний вектор ознак — «ембедінг» (embedding). Вимірюючи евклідову відстань між двома ембедінгами, система визначає ступінь схожості облич. Мала відстань свідчить про те, що це одна й та сама людина; більша відстань вказує на іншу особу. Це працює навіть тоді, коли відео зернисте або погано освітлене, оскільки ембедінги фіксують абстрактні характеристики обличчя, а не просто значення сирих пікселів.
Практичні перешкоди для слідчих
Існують дві перешкоди, які роблять біометричну верифікацію недоступною для багатьох тих, хто її потребує. По-перше, інструменти корпоративного рівня, що обіцяють високу точність, мають таку ціну, яку не можуть собі дозволити невеликі дослідницькі групи або незалежні слідчі. По-друге, споживчі додатки жертвують точністю заради зручності, демонструючи високий рівень хибнопозитивних результатів, які не витримали б юридичної перевірки. Поєднання високої вартості та ненадійних результатів змушує слідчих покладатися на ситуативні візуальні порівняння, які далекі від наукових методів.
Створення інструментів, які можуть витримати судовий розгляд
Розробникам, які прагнуть заповнити цю прогалину, варто дотримуватися триступеневої філософії проектування:
- Показуйте ступінь впевненості, а не лише бінарну відповідь. Повідомляйте про відстань між ембедінгами та дозволяйте користувачам встановлювати власні пороги. Прозорий показник дозволить адвокату аргументувати необхідність суворішого стандарту, якщо це потрібно.
- Перевіряйте походження файлу. Досліджуйте метадані, хеш-значення та URL-адреси джерел, щоб виявити підробку або неправильне віднесення. Шахраї часто вбудовують відео в оманливий контекст, тому конвеєр обробки має позначати підозріле походження.
- Надавайте пріоритет швидкості та ефективності використання ресурсів. Легкі моделі, побудовані на бібліотеках із відкритим кодом, можуть працювати на скромному обладнанні, що робить технологію доступною для приватних слідчих без шкоди для математичної обґрунтованості.
Окрім сухих цифр, результат має містити візуальні допоміжні засоби: накладені контрольні точки обличчя (facial landmarks).
Висновок: Справжня битва полягає не лише у виявленні синтетичних відео; вона полягає в тому, щоб надати слідчим математично обґрунтований спосіб підтвердити, хто саме перебуває на екрані. Розробники, які змістять фокус із детекції дипфейків на верифіковану біометричну ідентифікацію, допоможуть запобігти ситуаціям, коли один вірусний ролик може зруйнувати життя.
