Một tổ chức tội phạm đã thiết lập 15.500 trang web phát trực tuyến các video deep-fake của những nhân vật nổi tiếng nhằm quảng bá các lời khuyên chứng khoán giả mạo, và hoạt động này đang chiếm đoạt tiền từ những nhà đầu tư nhẹ dạ. Quy mô lớn của nó khiến việc gỡ bỏ thủ công là không thể, buộc các đội ngũ an ninh phải tư duy lại cách họ phát hiện và ngăn chặn loại gian lận này.
Cách thức hoạt động của băng nhóm này
Những kẻ lừa đảo không chỉ dựa vào một clip giả duy nhất. Mỗi trang web được lập trình để hoạt động khác nhau tùy thuộc vào người truy cập. Một trình thu thập dữ liệu (crawler) tự động sẽ thấy một trang "đang xây dựng" đơn điệu, trong khi một người dùng thực tế truy cập bằng thiết bị di động sẽ được hiển thị một video trau chuốt, có vẻ như là một người nổi tiếng đang quảng bá cho một mã cổ phiếu. Sự khác biệt này giúp hoạt động của chúng tránh được sự chú ý của các công cụ quét web truyền thống.
Để che giấu sự chuyển đổi này, nhóm này sử dụng các dịch vụ định tuyến lưu lượng như Keitaro, có khả năng che giấu URL và cung cấp nội dung khác nhau dựa trên uy tín IP, dấu vân tay thiết bị (device fingerprint) hoặc referrer header. Kết quả là một mạng lưới khổng lồ các tên miền "tương tự" hòa lẫn vào web thông thường, khiến các bot bảo mật khó có thể gắn cờ chúng là độc hại.
Tại sao các phương pháp phát hiện tiêu chuẩn lại thất bại
Hầu hết các giải pháp chống deep-fake tập trung vào việc phát hiện các lỗi hình ảnh (visual artefacts) tố cáo một video tổng hợp—như các cạnh bị mờ, ánh sáng không nhất quán hoặc khớp miệng không chuẩn. Trong chiến dịch này, những dấu hiệu đó rất hiếm vì các video được dựng bằng các mô hình chất lượng cao. Lỗ hổng thực sự nằm ở hình học khuôn mặt: các trình tạo deep-fake thường tạo ra những sai lệch nhỏ trong mối quan hệ không gian giữa các điểm mốc trên khuôn mặt (facial landmarks).
Do đó, một bước kiểm tra đơn giản kiểu "video này có phải giả không?" sẽ bỏ lỡ nhiều nội dung của băng nhóm này. Điều cần thiết là một bước xác minh nhằm so sánh khuôn mặt hiển thị trong video với một hình ảnh đáng tin cậy, đã biết của người nổi tiếng đó.
Xây dựng một quy trình xác minh
Các nhà phát triển có thể tích hợp ba khả năng cốt lõi vào quy trình bảo mật của họ:
- Thu thập dữ liệu thích ứng (Adaptive crawling) – Sử dụng các trình duyệt không giao diện (headless browsers) mô phỏng các user agent thực, xoay vòng IP và giả lập các đặc điểm của thiết bị di động. Điều này giúp vượt qua các trang "đang xây dựng" giả mạo và lấy được nội dung video thực tế.
- So sánh sinh trắc học (Biometric comparison) – Trích xuất các điểm mốc khuôn mặt từ mỗi khung hình của video và tính toán khoảng cách Euclidean so với ảnh tham chiếu chuẩn. Những lỗi nhỏ, nhất quán trong việc đặt điểm mốc là dấu hiệu mạnh mẽ của deep-fake. Việc thực hiện so sánh trên nhiều khung hình sẽ giảm thiểu các trường hợp dương tính giả do sự che khuất tạm thời hoặc thay đổi ánh sáng.
- Chuyển từ phát hiện sang xác minh – Thay vì gắn cờ một video là "có khả năng giả mạo", hãy coi nó là chưa được xác minh cho đến khi vượt qua bước kiểm tra sinh trắc học với một nguồn đã được kiểm duyệt. Nếu không tìm thấy sự trùng khớp, nội dung có thể bị cách ly hoặc gửi để con người xem xét.
Một triển khai thực tế có thể trông như sau:
- Crawler lấy trang web, theo dõi các lệnh chuyển hướng và ghi lại URL video cuối cùng.
- Downloader tải video về và chia nhỏ thành các khung hình chính (ví dụ: mỗi giây một khung hình).
- Face extractor chạy một mô hình nhẹ để xác định vị trí khuôn mặt trong mỗi khung hình.
- Landmark matcher tính toán khoảng cách Euclidean giữa các điểm mốc đã trích xuất và các điểm mốc từ ảnh chân dung chính thức của người nổi tiếng.
- Score aggregator gắn cờ video nếu khoảng cách trung vị vượt quá một ngưỡng xác định trước.
Vì hoạt động này trải dài trên hàng ngàn tên miền, việc tự động hóa từng bước là điều thiết yếu. Các thư viện mã nguồn mở để phát hiện khuôn mặt và trích xuất điểm mốc luôn sẵn có, và việc tính toán khoảng cách Euclidean tốn rất ít tài nguyên tính toán, cho phép quy trình này mở rộng quy mô lên hàng chục nghìn trang web mỗi ngày.
Những phản đối tiềm tàng
Một số đội ngũ bảo mật lập luận rằng việc xác minh sinh trắc học làm dấy lên lo ngại về quyền riêng tư, đặc biệt khi nó liên quan đến việc lưu trữ hình ảnh tham chiếu của các nhân vật công chúng. Lập luận phản bác là bộ tham chiếu có thể được giới hạn ở các ảnh đã được cấp phép và công khai, và không bao giờ được lưu trữ lâu dài sau bước so sánh. Rủi ro hàng triệu người dùng bị lừa mất tiền đầu tư lớn hơn nhiều so với việc xử lý dữ liệu ở mức độ khiêm tốn này.
Một phản đối khác là gánh nặng bảo trì để giữ cho thư viện tham chiếu luôn được cập nhật khi người nổi tiếng thay đổi diện mạo. Các bản cập nhật lũy tiến—thêm các ảnh chân dung mới khi chúng xuất hiện trên các phương tiện truyền thông đã được xác minh—sẽ giảm thiểu vấn đề này mà không cần phải xây dựng lại toàn bộ hệ thống.
Điều cần theo dõi tiếp theo
Việc nhóm này phụ thuộc vào các dịch vụ che giấu lưu lượng truy cập (traffic-masking services) đồng nghĩa với việc bất kỳ sự gián đoạn nào đối với các dịch vụ đó cũng có thể làm suy yếu chiến dịch một cách tạm thời, nhưng kỹ thuật cốt lõi—phân phối nội dung động kết hợp với deep-fake chất lượng cao—có khả năng sẽ tái diễn trong các vụ lừa đảo khác. Các nhà cung cấp giải pháp bảo mật nên theo dõi các dấu hiệu tương tự: nội dung khác biệt dựa trên chữ ký của trình thu thập dữ liệu (crawler signatures), sự gia tăng đột biến của các tên miền trỏ về cùng một kho lưu trữ video (video hosting bucket), và việc sử dụng lặp lại các chữ ký lỗi hình học khuôn mặt (facial-geometry error signatures) giống nhau.
Đối với các nhà phát triển, bước tiếp theo là xây dựng nguyên mẫu quy trình xác thực (verification pipeline) trên một nhóm nhỏ các tên miền khả nghi và đo lường tỷ lệ dương tính giả (false-positive rates). Việc chia sẻ các chữ ký phát hiện (detection signatures) giữa các tổ chức cũng có thể giúp giảm thiểu sự trùng lặp trong nỗ lực triển khai.
Bài học rút ra: Vụ lừa đảo deep-fake quy mô 15.500 trang web cho thấy quy mô, chứ không chỉ là sự tinh vi, chính là ranh giới mới của gian lận. Bằng cách kết hợp thu thập dữ liệu thích ứng (adaptive crawling) với xác thực sinh trắc học theo từng khung hình (frame-by-frame biometric verification), các đội ngũ bảo mật có thể biến một vấn đề quá lớn thành một hệ thống phòng thủ tự động và có thể đo lường được.
