भारतातील एका शिक्षकाला वर्गातील एका घटनेचा व्हिडिओ ग्रुप चॅटद्वारे व्हायरल झाल्यानंतर निलंबित करण्यात आले, आणि तो व्हिडिओ खरा आहे की AI-निर्मित (AI-generated) आहे यावर प्रेक्षकांमध्ये वाद सुरू झाला. या गोंधळाने “liar’s dividend” (खोटारड्याचा लाभांश) या संकल्पनेवर प्रकाश टाकला आहे – म्हणजेच कृत्रिम मीडियाच्या (synthetic media) केवळ अस्तित्वामुळे कोणीही खऱ्या पुराव्यांवर संशय व्यक्त करू शकतो – आणि हे सध्याच्या डीप-फेक (deep-fake) डिटेक्टर्समधील एका त्रुटीला (blind spot) उघड करते.

इशारा देणारी घटना

व्हिडिओ व्हायरल होताच, एक समांतर वाद निर्माण झाला: काही वापरकर्त्यांनी डीप-फेक असल्याचे दर्शवणारे काही तांत्रिक दोष (glitches) दाखवले, तर इतरांचे म्हणणे होते की फेरफार (manipulation) करण्याची शक्यता असल्यामुळे कोणताही दृश्य पुरावा अविश्वसनीय ठरतो.

सध्याचे डीप-फेक डिटेक्टर्स अपुरे का पडतात

बहुतेक अँटी-डीप-फेक (anti-deep-fake) उपाय जनरेटिव्ह मॉडेल्सनी (generative models) सोडलेले आर्टिफॅक्ट्स (artifacts) शोधतात – जसे की विचित्र पिक्सेल पॅटर्न, विसंगत प्रकाश किंवा विसंगत ऑडिओ संकेत. हे संकेत कृत्रिम मूळ असल्याचे सूचित करू शकतात, परंतु फ्रेममध्ये प्रत्यक्षात कोण दिसत आहे याची खात्री करण्यासाठी ते काहीच करत नाहीत. न्यायालयात किंवा शिस्तभंगविषयक सुनावणीत, व्हिडिओ "कदाचित बनावट आहे" असा संभाव्यता स्कोअर (probability score) ओळखीचा प्रश्न सोडवू शकत नाही. सध्याचा भर "हा व्हिडिओ बनावट आहे का?" यावर असल्याने, जेव्हा खरा प्रश्न "हा व्हिडिओ ज्या व्यक्तीचा दावा करतो तीच व्यक्ती दाखवतो का?" असा असतो, तेव्हा एक मोठी त्रुटी निर्माण होते.

पडताळणीयोग्य बायोमेट्रिक ओळखीची गरज

तपासकर्त्यांना गणितीय अचूकतेसह (mathematical rigor) हे सिद्ध करण्यासाठी एका मार्गाची गरज आहे की व्हिडिओमधील चेहरा एका विशिष्ट व्यक्तीचाच आहे. आधुनिक कॉम्प्युटर-व्हिजन पाइपलाईन्स (computer-vision pipelines) प्रत्येक चेहऱ्यातून एक हाय-डायमेंशनल फीचर वेक्टर – एक “एम्बेडिंग” (embedding) – काढतात. दोन एम्बेडिंगमधील युक्लिडियन अंतर (Euclidean distance) मोजून, सिस्टीम चेहरे किती सारखे आहेत याचे प्रमाण ठरवते. कमी अंतर म्हणजे तीच व्यक्ती; जास्त अंतर म्हणजे वेगळी व्यक्ती. व्हिडिओ अस्पष्ट किंवा कमी प्रकाशात असला तरीही हे काम करते, कारण एम्बेडिंग्स केवळ पिक्सेल व्हॅल्यूजऐवजी चेहऱ्याची अमूर्त वैशिष्ट्ये टिपतात.

तपासकर्त्यांसाठी व्यावहारिक अडथळे

दोन अडथळ्यांमुळे बायोमेट्रिक पडताळणी ज्यांना आवश्यक आहे त्यांच्यापासून ती दूर राहते. पहिले म्हणजे, उच्च अचूकतेचे आश्वासन देणारी एंटरप्राइझ-ग्रेड (enterprise-grade) साधने इतकी महाग असतात की लहान संशोधन पथके किंवा स्वतंत्र तपासकर्ते ती परवडू शकत नाहीत. दुसरे म्हणजे, ग्राहक-केंद्रित (consumer-focused) ॲप्स सोयीसाठी अचूकतेशी तडजोड करतात, ज्यामुळे 'फॉल्स-पॉझिटिव्ह' (false-positive) दर वाढतो, जो कायदेशीर चौकशीत टिकू शकत नाही. खर्च आणि अविश्वसनीय निकाल यांच्या एकत्रित परिणामामुळे तपासकर्त्यांना केवळ दृश्य तुलनांवर अवलंबून राहावे लागते, जे वैज्ञानिकदृष्ट्या योग्य नसते.

न्यायालयात टिकू शकतील अशी साधने तयार करणे

ही त्रुटी भरून काढण्याचे ध्येय ठेवणाऱ्या डेव्हलपर्सनी तीन-टप्प्यांच्या डिझाइन तत्त्वाचे पालन केले पाहिजे:

  • केवळ बायनरी उत्तर न देता आत्मविश्वास दर्शवा. एम्बेडिंगमधील अंतर रिपोर्ट करा आणि वापरकर्त्यांना त्यांचे स्वतःचे थ्रेशोल्ड (thresholds) सेट करू द्या. पारदर्शक स्कोअरमुळे गरज पडल्यास वकील अधिक कडक मानकासाठी युक्तिवाद करू शकतात.
  • फाईलचा उगम (provenance) पडताळा. फेरफार किंवा चुकीचे श्रेय शोधण्यासाठी मेटाडेटा, हॅश व्हॅल्यूज आणि सोर्स URLs तपासा. स्कॅमर्स अनेकदा व्हिडिओ चुकीच्या संदर्भात वापरतात, त्यामुळे पाइपलाइनने संशयास्पद उगम दर्शवणे आवश्यक आहे.
  • वेग आणि संसाधनांच्या कार्यक्षमतेला प्राधान्य द्या. ओपन-सोर्स लायब्ररीवर आधारित हलके (light-weight) मॉडेल्स सामान्य हार्डवेअरवर चालू शकतात, ज्यामुळे गणितीय अचूकता न गमावता तंत्रज्ञान स्वतंत्र तपासकर्त्यांना सहज उपलब्ध होऊ शकते.

केवळ आकड्यांच्या पलीकडे जाऊन, आउटपुटमध्ये व्हिज्युअल एड्स (visual aids) असावेत: जसे की ओव्हरले केलेले फेशियल लँडमार्क (facial landmarks).

निष्कर्ष (Takeaway): खरी लढाई केवळ कृत्रिम व्हिडिओ ओळखण्याबद्दल नाही; तर स्क्रीनवर कोण आहे याची खात्री करण्यासाठी तपासकर्त्यांना गणितीयदृष्ट्या सक्षम मार्ग उपलब्ध करून देण्याबद्दल आहे. जे डेव्हलपर्स डीप-फेक डिटेक्शनकडून पडताळणीयोग्य बायोमेट्रिक ओळखीकडे वळतील, ते एखादा व्हायरल व्हिडिओ कोणाचे तरी आयुष्य उद्ध्वस्त करण्यापासून रोखण्यास मदत करतील.