एका गुन्हेगारी टोळीने १५,५०० वेबसाइट्स तयार केल्या आहेत, ज्या प्रसिद्ध व्यक्तींचे डीप-फेक (deep-fake) व्हिडिओ स्ट्रीम करून बनावट स्टॉक टिप्सचा प्रचार करतात. या प्रक्रियेमुळे निष्पाप गुंतवणूकदारांचे पैसे आधीच लुटले जात आहेत. या फसवणुकीचे प्रमाण इतके मोठे आहे की मॅन्युअल पद्धतीने या वेबसाइट्स काढून टाकणे अशक्य झाले आहे, ज्यामुळे सुरक्षा पथकांना अशा प्रकारची फसवणूक कशी ओळखायची आणि रोखायची यावर पुन्हा विचार करण्यास भाग पाडले आहे.

हे जाळे कसे काम करते

स्कॅमर्स केवळ एका बनावट क्लिपवर अवलंबून राहत नाहीत. प्रत्येक साइटला भेट देणाऱ्या व्यक्तीनुसार ती वेगळ्या प्रकारे वागण्यासाठी प्रोग्राम केलेली असते. एखादा ऑटोमेटेड क्रॉलर (automated crawler) पाहतो तेव्हा त्याला एक साधे “under construction” पेज दिसते, तर मोबाईल डिव्हाइसवरून येणाऱ्या खऱ्या वापरकर्त्याला एखादी सेलिब्रिटी स्टॉकचा प्रचार करत असल्याचा उच्च दर्जाचा व्हिडिओ दाखवला जातो. ही तफावत या प्रक्रियेला पारंपारिक वेब-स्क्रॅपिंग टूल्सच्या नजरेआड राहण्यास मदत करते.

ही अदलाबदल लपवण्यासाठी, हे गट Keitaro सारख्या ट्रॅफिक-रूटिंग सेवांचा वापर करतात, जे URL लपवू शकतात आणि IP reputation, device fingerprint किंवा referrer header च्या आधारे वेगवेगळे कंटेंट दाखवू शकतात. याचा परिणाम म्हणजे “हुबेहूब दिसणाऱ्या” डोमेन्सचे एक मोठे जाळे तयार होते जे सामान्य वेबमध्ये मिसळून जाते, ज्यामुळे सुरक्षा बॉट्सना ते घातक म्हणून ओळखणे कठीण जाते.

मानक शोध यंत्रणा अपयशी का ठरते

बहुतेक अँटी-डीप-फेक सोल्यूशन्स केवळ व्हिज्युअल आर्टिफॅक्ट्स (visual artefacts) शोधण्यावर लक्ष केंद्रित करतात, जे सिंथेटिक व्हिडिओचा खुलासा करतात—जसे की अस्पष्ट कडा (blurry edges), विसंगत प्रकाश (inconsistent lighting), किंवा चुकीचे लिप सिंक (mismatched lip sync). या मोहिमेमध्ये, असे संकेत क्वचितच आढळतात कारण व्हिडिओ उच्च-गुणवत्तेच्या मॉडेल्ससह तयार केले जातात. खरी त्रुटी चेहऱ्याच्या भूमितीमध्ये (geometry) असते: डीप-फेक जनरेटर्स अनेकदा फेशियल लँडमार्क्समधील (facial landmarks) अवकाशीय संबंधांमध्ये सूक्ष्म तफावत निर्माण करतात.

त्यामुळे, “हा व्हिडिओ बनावट आहे का?” असा साधा तपास अनेकदा या जाळ्यातील कंटेंट ओळखण्यात अपयशी ठरतो. यासाठी अशा पडताळणीच्या (verification) पायरीची गरज आहे जी व्हिडिओमध्ये दिसणारा चेहरा एखाद्या सेलिब्रिटीच्या ज्ञात आणि विश्वसनीय फोटोशी तुलना करते.

पडताळणी पाइपलाइन तयार करणे

डेव्हलपर्स त्यांच्या सुरक्षा कार्यप्रवाहमध्ये (security workflows) तीन मुख्य क्षमता समाविष्ट करू शकतात:

  • अडॅप्टिव्ह क्रॉलिंग (Adaptive crawling) – खऱ्या वापरकर्त्यांसारखे वागणारे हेडलेस ब्राउझर्स (headless browsers) वापरा, जे IP बदलतात आणि मोबाईल डिव्हाइसची वैशिष्ट्ये अनुकरण करतात. यामुळे “under construction” सारख्या फसव्या पेजेसना बगल देऊन प्रत्यक्ष व्हिडिओ मिळवण्यास मदत होते.
  • बायोमेट्रिक तुलना (Biometric comparison) – व्हिडिओच्या प्रत्येक फ्रेममधून फेशियल लँडमार्क्स काढा आणि ते मूळ संदर्भ फोटोच्या लँडमार्कशी तुलना करण्यासाठी युक्लिडियन अंतर (Euclidean distances) मोजा. लँडमार्कच्या स्थानामध्ये होणाऱ्या लहान आणि सातत्यपूर्ण त्रुटी हे डीप-फेकचे प्रबळ लक्षण आहे. अनेक फ्रेम्समध्ये ही तुलना केल्यामुळे क्षणिक अडथळे किंवा प्रकाश बदलांमुळे होणारे चुकीचे निकाल (false positives) कमी होतात.
  • शोधण्याऐवजी पडताळणीवर भर देणे (Shift from detection to verification) – व्हिडिओला “संभाव्यतः बनावट” म्हणून चिन्हांकित करण्याऐवजी, जोपर्यंत तो प्रमाणित स्रोताशी बायोमेट्रिक तपासणीत उत्तीर्ण होत नाही, तोपर्यंत त्याला 'अपुष्ट' (unverified) माना. जर कोणताही मॅच सापडला नाही, तर तो कंटेंट क्वारंटाईन केला जाऊ शकतो किंवा मानवी पुनरावलोकनासाठी पाठवला जाऊ शकतो.

एक व्यावहारिक अंमलबजावणी खालीलप्रमाणे असू शकते:

  1. Crawler पेज मिळवतो, रिडायरेक्ट्स फॉलो करतो आणि अंतिम व्हिडिओ URL रेकॉर्ड करतो.
  2. Downloader व्हिडिओ डाऊनलोड करतो आणि त्याचे महत्त्वाच्या फ्रेम्समध्ये (उदा. प्रति सेकंद एक) विभाजन करतो.
  3. Face extractor प्रत्येक फ्रेममधील चेहरा शोधण्यासाठी एक हलके मॉडेल चालवतो.
  4. Landmark matcher काढलेले लँडमार्क आणि सेलिब्रिटीच्या अधिकृत पोर्ट्रेटमधील लँडमार्क यांच्यातील युक्लिडियन अंतर मोजतो.
  5. Score aggregator जर मध्यवर्ती अंतर (median distance) पूर्वनिर्धारित मर्यादेपेक्षा जास्त असेल, तर व्हिडिओला फ्लॅग करतो.

ही मोहीम हजारो डोमेन्समध्ये पसरलेली असल्याने, प्रत्येक पायरी स्वयंचलित करणे आवश्यक आहे. फेस डिटेक्शन आणि लँडमार्क एक्स्ट्रॅक्शनसाठी ओपन-सोर्स लायब्ररी सहज उपलब्ध आहेत आणि युक्लिडियन-डिस्टन्सची गणना संगणकीयदृष्ट्या सोपी आहे, ज्यामुळे ही पाइपलाइन दररोज हजारो साइट्सपर्यंत विस्तारू शकते.

संभाव्य विरोध

काही सुरक्षा पथकांचा असा युक्तिवाद आहे की बायोमेट्रिक पडताळणीमुळे गोपनीयतेच्या समस्या निर्माण होऊ शकतात, विशेषतः जेव्हा यामध्ये सार्वजनिक व्यक्तींचे संदर्भ फोटो साठवण्याचा समावेश असतो. यावर प्रतिवाद असा आहे की, संदर्भ संच केवळ सार्वजनिकरित्या उपलब्ध असलेल्या, परवानाधारक फोटोंपुरता मर्यादित ठेवला जाऊ शकतो आणि तुलना करण्याच्या पायरीनंतर तो कधीही साठवून ठेवला जाणार नाही. लाखो वापरकर्त्यांचे गुंतवणूक निधी फसवले जाण्याचा धोका हा डेटा हाताळणीच्या किरकोळ जोखमीपेक्षा कितीतरी मोठा आहे.

दुसरा आक्षेप म्हणजे सेलिब्रिटी त्यांचे स्वरूप बदलत असताना संदर्भ लायब्ररी अद्ययावत ठेवण्याचा देखभालीचा खर्च (maintenance overhead). सेलिब्रिटींचे नवीन फोटो पडताळणीकृत मीडियामध्ये दिसताच ते जोडणे—अशा टप्प्याटप्प्याने होणाऱ्या अपडेट्समुळे पूर्ण लायब्ररी पुन्हा तयार न करता ही समस्या सोडवता येते.

पुढे काय पाहावे

या टोळीचे ट्रॅफिक-मास्किंग सेवांवरील अवलंबित्व याचा अर्थ असा आहे की, त्या सेवांमध्ये कोणताही व्यत्यय आल्यास या मोहिमेचा प्रभाव तात्पुरता कमी होऊ शकतो, परंतु मूळ तंत्र—डायनॅमिक कंटेंट डिलिव्हरी आणि उच्च-गुणवत्तेचे डीप-फेक्सचे संयोजन—इतर घोटाळ्यांमध्येही पुन्हा दिसून येईल. सुरक्षा विक्रेत्यांनी अशाच प्रकारच्या पॅटर्नवर लक्ष ठेवले पाहिजे: क्रॉलर सिग्नेचरवर आधारित भिन्न कंटेंट, एकाच व्हिडिओ होस्टिंग बकेटकडे निर्देश करणाऱ्या डोमेनमध्ये अचानक झालेली वाढ आणि एकाच फेशियल-ज्यामेट्री एरर सिग्नेचरचा वारंवार वापर.

डेव्हलपर्ससाठी, पुढील पाऊल म्हणजे संशयास्पद डोमेनच्या एका लहान संचावर व्हेरिफिकेशन पाइपलाइनचा प्रोटोटाइप तयार करणे आणि फॉल्स-पॉझिटिव्ह दर मोजणे. विविध संस्थांमध्ये डिटेक्शन सिग्नेचर शेअर केल्यामुळे कामाची पुनरावृत्ती देखील कमी होऊ शकते.

निष्कर्ष: १५,५०० साइट्सचा डीप-फेक घोटाळा हे दर्शवतो की, फसवणुकीचे नवीन क्षेत्र केवळ गुंतागुंत नसून त्याची व्याप्ती (scale) देखील आहे. अडॅप्टिव्ह क्रॉलिंग आणि फ्रेम-बाय-फ्रेम बायोमेट्रिक व्हेरिफिकेशन एकत्र करून, सुरक्षा पथके एका अवाढव्य समस्येला स्वयंचलित आणि मोजण्यायोग्य संरक्षणात बदलू शकतात.