ขบวนการอาชญากรรมได้สร้างเว็บไซต์ถึง 15,500 แห่ง เพื่อสตรีมวิดีโอดีพเฟก (deep-fake) ของบุคคลที่มีชื่อเสียงเพื่อโฆษณาคำแนะนำหุ้นปลอม และปฏิบัติการนี้กำลังดูดเงินจากนักลงทุนที่ไม่ทันระวังตัวไปแล้ว ขนาดของปฏิบัติการนี้ทำให้การไล่ลบด้วยมือเป็นไปไม่ได้เลย ส่งผลให้ทีมรักษาความปลอดภัยต้องคิดใหม่ว่าจะตรวจจับและบล็อกการฉ้อโกงเช่นนี้ได้อย่างไร

วิธีการดำเนินงานของขบวนการ

มิจฉาชีพไม่ได้พึ่งพาวิดีโอปลอมเพียงคลิปเดียว แต่ละไซต์ถูกตั้งโปรแกรมให้แสดงผลแตกต่างกันไปขึ้นอยู่กับว่าใครเป็นผู้เข้าชม หากเป็นโปรแกรม crawler อัตโนมัติจะเห็นหน้าเว็บ "กำลังปรับปรุง" ที่ดูธรรมดา แต่หากเป็นผู้ใช้จริงที่เข้าผ่านอุปกรณ์มือถือ จะได้รับวิดีโอที่ดูเนียนตาซึ่งแสดงภาพคนดังกำลังแนะนำหุ้น ความแตกต่างนี้ช่วยให้ปฏิบัติการสามารถหลบเลี่ยงเครื่องมือ web-scraping แบบดั้งเดิมได้

เพื่อปกปิดการสลับเนื้อหา กลุ่มนี้ใช้บริการจัดเส้นทางทราฟฟิก (traffic-routing services) เช่น Keitaro ซึ่งสามารถพราง URL และแสดงเนื้อหาที่แตกต่างกันตามชื่อเสียงของ IP (IP reputation), ลายนิ้วมืออุปกรณ์ (device fingerprint) หรือ referrer header ผลลัพธ์ที่ได้คือเครือข่ายโดเมน "หน้าตาคล้ายกัน" จำนวนมหาศาลที่กลมกลืนไปกับเว็บทั่วไป ทำให้บอทรักษาความปลอดภัยตรวจจับได้ยากว่าเป็นเว็บไซต์ที่เป็นอันตราย

ทำไมการตรวจจับแบบมาตรฐานจึงไม่ได้ผล

โซลูชันป้องกันดีพเฟกส่วนใหญ่มุ่งเน้นไปที่การตรวจจับร่องรอยทางภาพ (visual artefacts) ที่บ่งบอกว่าเป็นวิดีโอสังเคราะห์ เช่น ขอบภาพที่เบลอ, แสงที่ไม่สอดคล้อง หรือการขยับปากที่ไม่ตรงกับเสียง (lip sync) ในแคมเปญนี้ ร่องรอยเหล่านั้นพบได้ยากเพราะวิดีโอถูกสร้างด้วยโมเดลคุณภาพสูง จุดอ่อนที่แท้จริงอยู่ที่โครงสร้างทางเรขาคณิตของใบหน้า: ตัวสร้างดีพเฟกมักจะสร้างความคลาดเคลื่อนเล็กน้อยในความสัมพันธ์เชิงพื้นที่ระหว่างจุดสำคัญบนใบหน้า (facial landmarks)

ดังนั้น การตรวจสอบง่ายๆ ว่า "วิดีโอนี้ปลอมหรือไม่?" จึงพลาดเนื้อหาจำนวนมากของขบวนการนี้ สิ่งที่จำเป็นคือขั้นตอน การยืนยัน (verification) ที่เปรียบเทียบใบหน้าที่ปรากฏในวิดีโอกับภาพถ่ายที่เชื่อถือได้ของคนดังคนนั้น

การสร้างเวิร์กโฟลว์การยืนยัน (Verification Pipeline)

นักพัฒนาสามารถฝังความสามารถหลักสามประการไว้ในเวิร์กโฟลว์ด้านความปลอดภัยได้:

  • Adaptive crawling – ใช้ headless browsers ที่เลียนแบบ user agents ของผู้ใช้จริง, สลับ IP และจำลองลักษณะของอุปกรณ์มือถือ วิธีนี้จะช่วยข้ามผ่านหน้าเว็บ "กำลังปรับปรุง" ที่ทำไว้หลอก และดึงข้อมูลวิดีโอ (video payload) จริงออกมาได้
  • Biometric comparison – สกัดจุดสำคัญบนใบหน้า (facial landmarks) จากแต่ละเฟรมของวิดีโอ และคำนวณระยะห่างแบบยูคลิด (Euclidean distances) เทียบกับภาพอ้างอิงที่แท้จริง ความผิดพลาดเล็กน้อยที่เกิดขึ้นอย่างต่อเนื่องในการวางตำแหน่งจุดสำคัญเป็นตัวบ่งชี้ที่ชัดเจนของดีพเฟก การเปรียบเทียบผ่านหลายๆ เฟรมจะช่วยลดผลบวกปลอม (false positives) ที่เกิดจากการถูกบดบังชั่วขณะหรือการเปลี่ยนแปลงของแสง
  • Shift from detection to verification – แทนที่จะทำเครื่องหมายวิดีโอว่า "อาจเป็นของปลอม" ให้ถือว่าวิดีโอนั้น "ยังไม่ได้รับการยืนยัน" จนกว่าจะผ่านการตรวจสอบทางชีวมิติ (biometric check) กับแหล่งข้อมูลที่ผ่านการตรวจสอบแล้ว หากไม่พบข้อมูลที่ตรงกัน เนื้อหานั้นสามารถถูกกักกัน (quarantined) หรือส่งให้มนุษย์ตรวจสอบได้

การนำไปใช้งานจริงอาจมีลักษณะดังนี้:

  1. Crawler ดึงหน้าเว็บ, ติดตามการเปลี่ยนเส้นทาง (redirects) และบันทึก URL ของวิดีโอสุดท้าย
  2. Downloader ดึงวิดีโอและแบ่งออกเป็นเฟรมสำคัญ (เช่น หนึ่งเฟรมต่อวินาที)
  3. Face extractor ใช้โมเดลน้ำหนักเบาเพื่อระบุตำแหน่งใบหน้าในแต่ละเฟรม
  4. Landmark matcher คำนวณระยะห่างแบบยูคลิดระหว่างจุดสำคัญที่สกัดได้กับจุดสำคัญจากภาพพอร์ตเทรตอย่างเป็นทางการของคนดัง
  5. Score aggregator ทำเครื่องหมายวิดีโอหากค่ามัธยฐานของระยะห่างเกินเกณฑ์ที่กำหนดไว้

เนื่องจากปฏิบัติการนี้ครอบคลุมโดเมนหลายพันแห่ง การทำให้แต่ละขั้นตอนเป็นอัตโนมัติจึงเป็นสิ่งจำเป็น ไลบรารีโอเพนซอร์ส (open-source libraries) สำหรับการตรวจจับใบหน้าและการสกัดจุดสำคัญนั้นมีให้ใช้งานทั่วไป และการคำนวณระยะห่างแบบยูคลิดก็ใช้ทรัพยากรคำนวณต่ำ ทำให้ระบบสามารถขยายขนาดเพื่อรองรับเว็บไซต์หลายหมื่นแห่งต่อวันได้

ข้อโต้แย้งที่อาจเกิดขึ้น

ทีมรักษาความปลอดภัยบางทีมโต้แย้งว่าการยืนยันทางชีวมิติทำให้เกิดความกังวลด้านความเป็นส่วนตัว โดยเฉพาะเมื่อต้องมีการจัดเก็บภาพอ้างอิงของบุคคลสาธารณะ ข้อโต้แย้งในทางกลับกันคือ ชุดข้อมูลอ้างอิงสามารถจำกัดอยู่เพียงภาพถ่ายที่มีลิขสิทธิ์และเผยแพร่ต่อสาธารณะ และจะไม่ถูกจัดเก็บไว้ถาวรเกินกว่าขั้นตอนการเปรียบเทียบ ความเสี่ยงที่ผู้ใช้หลายล้านคนจะถูกหลอกจนสูญเสียเงินลงทุนนั้นมีน้ำหนักมากกว่าการจัดการข้อมูลเพียงเล็กน้อยนี้

อีกข้อโต้แย้งหนึ่งคือภาระในการดูแลรักษาเพื่อรักษาไลบรารีอ้างอิงให้ทันสมัยเมื่อคนดังเปลี่ยนรูปลักษณ์ การอัปเดตแบบส่วนเพิ่ม (incremental updates)—เช่น การเพิ่มภาพถ่ายใหม่ๆ เมื่อปรากฏในสื่อที่ได้รับการยืนยัน—จะช่วยบรรเทาปัญหานี้ได้โดยไม่จำเป็นต้องสร้างระบบใหม่ทั้งหมด

สิ่งที่ต้องจับตาดูต่อไป

การที่เครือข่ายนี้พึ่งพาบริการพรางทราฟฟิก (traffic-masking services) หมายความว่าหากบริการเหล่านั้นหยุดชะงักลง อาจทำให้แคมเปญนี้ชะงักลงชั่วคราว แต่เทคนิคพื้นฐานอย่างการส่งเนื้อหาแบบไดนามิก (dynamic content delivery) ควบคู่ไปกับดีพเฟก (deep-fakes) คุณภาพสูง มีแนวโน้มที่จะปรากฏขึ้นอีกในกลโกงอื่นๆ ผู้ให้บริการด้านความปลอดภัยควรเฝ้าระวังรูปแบบที่คล้ายคลึงกัน เช่น เนื้อหาที่แตกต่างกันโดยอิงตามลายเซ็นของ crawler (crawler signatures), การเพิ่มขึ้นอย่างรวดเร็วของโดเมนที่ชี้ไปยัง video hosting bucket เดียวกัน และการใช้ลายเซ็นข้อผิดพลาดของรูปทรงใบหน้า (facial-geometry error signatures) แบบเดิมซ้ำๆ

สำหรับนักพัฒนา ขั้นตอนต่อไปคือการสร้างต้นแบบของกระบวนการตรวจสอบ (verification pipeline) กับกลุ่มย่อยของโดเมนที่น่าสงสัย และวัดอัตรา false-positive การแบ่งปันลายเซ็นการตรวจจับ (detection signatures) ระหว่างองค์กรยังสามารถช่วยลดความซ้ำซ้อนในการทำงานได้อีกด้วย

ประเด็นสำคัญ: การหลอกลวงด้วยดีพเฟกผ่านเว็บไซต์กว่า 15,500 แห่ง แสดงให้เห็นว่า "ขนาด" (scale) ไม่ใช่แค่ "ความซับซ้อน" (sophistication) แต่คือพรมแดนใหม่ของการฉ้อโกง การผสมผสานการทำ adaptive crawling เข้ากับการตรวจสอบอัตลักษณ์ทางชีวภาพแบบเฟรมต่อเฟรม (frame-by-frame biometric verification) จะช่วยให้ทีมรักษาความปลอดภัยสามารถเปลี่ยนปัญหาที่ถาโถมเข้ามาให้กลายเป็นการป้องกันแบบอัตโนมัติที่วัดผลได้