Một giáo viên tại Ấn Độ đã bị đình chỉ công tác sau khi một video về sự cố trong lớp học lan truyền qua một nhóm chat, và người xem đã tranh cãi liệu đoạn clip đó là thật hay do AI tạo ra. Sự náo động này làm nổi bật "lợi tức của kẻ nói dối" (liar’s dividend) – cách mà sự tồn tại đơn thuần của các phương tiện truyền thông tổng hợp cho phép bất kỳ ai cũng có thể nghi ngờ các bằng chứng thực tế – và nó phơi bày một điểm mù trong làn sóng các công cụ phát hiện deep-fake hiện nay.

Vụ việc khơi mào sự báo động

Khi đoạn phim trở nên lan truyền, một cuộc tranh luận song song đã nổ ra: một số người dùng chỉ ra những lỗi kỹ thuật (glitches) dễ nhận thấy có thể là dấu hiệu của deep-fake, trong khi những người khác cho rằng chính khả năng bị thao túng đã khiến mọi bằng chứng hình ảnh trở nên không đáng tin cậy.

Tại sao các công cụ phát hiện deep-fake hiện nay vẫn chưa đáp ứng được yêu cầu

Hầu hết các giải pháp chống deep-fake đều săn tìm các dấu vết (artifacts) do các mô hình tạo sinh để lại – như các mẫu pixel kỳ lạ, ánh sáng không nhất quán hoặc các tín hiệu âm thanh không khớp. Những manh mối đó có thể đánh dấu một nguồn gốc tổng hợp, nhưng chúng không làm gì để xác nhận ai thực sự xuất hiện trong khung hình. Trong một phiên tòa hoặc một buổi điều trần kỷ luật, một điểm số xác suất cho thấy video "có khả năng là giả" không thể giải quyết được câu hỏi về danh tính. Trọng tâm hiện tại vào câu hỏi "video này có phải là giả không?" đã để lại một khoảng trống khi vấn đề thực sự là "video này có đang hiển thị đúng người mà nó tuyên bố hay không?"

Nhu cầu về định danh sinh trắc học có thể xác minh

Các nhà điều tra cần một cách để chứng minh, với sự chặt chẽ về mặt toán học, rằng khuôn mặt trong video thuộc về một cá nhân cụ thể. Các quy trình thị giác máy tính hiện đại trích xuất một vectơ đặc trưng cao chiều – một "embedding" – từ mỗi khuôn mặt. Bằng cách đo khoảng cách Euclidean giữa hai embedding, hệ thống sẽ định lượng mức độ tương đồng giữa các khuôn mặt. Khoảng cách nhỏ cho thấy cùng một người; khoảng cách lớn hơn ngụ ý một cá nhân khác. Điều này vẫn hoạt động ngay cả khi đoạn phim bị nhiễu hoặc thiếu sáng, vì các embedding nắm bắt các đặc điểm khuôn mặt trừu tượng thay vì các giá trị pixel thô.

Những rào cản thực tế đối với các nhà điều tra

Có hai trở ngại khiến việc xác minh sinh trắc học nằm ngoài tầm với của nhiều người cần đến nó. Thứ nhất, các công cụ cấp doanh nghiệp hứa hẹn độ chính xác cao thường đi kèm với mức giá mà các nhóm nghiên cứu nhỏ hoặc các nhà điều tra độc lập không thể chi trả. Thứ hai, các ứng dụng hướng tới người tiêu dùng thường đánh đổi độ chính xác lấy sự tiện lợi, dẫn đến tỷ lệ dương tính giả cao, điều này sẽ không thể đứng vững trước sự xem xét của pháp luật. Sự kết hợp giữa chi phí và kết quả không đáng tin cậy buộc các nhà điều tra phải dựa vào các so sánh hình ảnh cảm tính, vốn còn lâu mới đạt được tính khoa học.

Xây dựng các công cụ có thể đứng vững trước tòa

Các nhà phát triển nhằm lấp đầy khoảng trống này nên tuân theo triết lý thiết kế ba bước:

  • Hiển thị mức độ tin cậy, không chỉ là một câu trả lời nhị phân. Báo cáo khoảng cách giữa các embedding và cho phép người dùng tự thiết lập ngưỡng của riêng họ. Một điểm số minh bạch cho phép luật sư tranh luận về một tiêu chuẩn khắt khe hơn nếu cần thiết.
  • Xác minh nguồn gốc tệp. Kiểm tra siêu dữ liệu (metadata), giá trị băm (hash values) và URL nguồn để phát hiện sự giả mạo hoặc gán sai nguồn. Những kẻ lừa đảo thường chèn video vào các ngữ cảnh gây hiểu lầm, vì vậy một quy trình phải gắn cờ các nguồn gốc khả nghi.
  • Ưu tiên tốc độ và hiệu quả tài nguyên. Các mô hình nhẹ được xây dựng trên các thư viện mã nguồn mở có thể chạy trên các phần cứng khiêm tốn, giúp công nghệ này trở nên dễ tiếp cận với các nhà điều tra độc lập mà không làm mất đi tính chặt chẽ về mặt toán học.

Ngoài các con số thô, kết quả đầu ra nên bao gồm các hỗ trợ trực quan: các điểm mốc khuôn mặt (facial landmarks) được chèn đè lên.

Bài học rút ra: Cuộc chiến thực sự không chỉ là phát hiện các video tổng hợp; mà là cung cấp cho các nhà điều tra một phương pháp chặt chẽ về mặt toán học để xác nhận ai đang ở trên màn hình. Các nhà phát triển chuyển hướng từ việc phát hiện deep-fake sang định danh sinh trắc học có thể xác minh sẽ giúp ngăn chặn một đoạn clip lan truyền duy nhất hủy hoại một cuộc đời.