مہاراشٹر میں دھوکے بازوں نے AI سے تیار کردہ آواز (speech) کا استعمال کرتے ہوئے ایک متاثرہ شخص سے ₹11.8 لاکھ چوری کر لیے، جسے لگا کہ وہ ایک ممکنہ دلہن کے خاندان سے بات کر رہا ہے۔ یہ فراڈ ایک 'زیرو شاٹ وائس کلوننگ ماڈل' (zero-shot voice-cloning model) پر مبنی تھا جس نے صرف چند سیکنڈ کے آڈیو سے متاثرہ شخص کے لہجے کی نقل کر لی، اور ایک ذاتی گفتگو کو ہتھیار میں بدل دیا۔

فراڈ کیسے ہوا

مجرموں نے سب سے پہلے عوامی ذرائع—جیسے سوشل میڈیا پوسٹس، وائس میل کے ٹکڑے، یا میسجنگ ایپس—سے ہدف کی آواز کے 3 سے 30 سیکنڈ کے کلپس حاصل کیے۔ جدید اسپیچ سنتیسز (speech-synthesis) ٹولز اس مختصر نمونے کو اضافی ٹریننگ ڈیٹا کے بغیر ایک قائل کرنے والے نقل میں بدل دیتے ہیں، جسے 'زیرو شاٹ سنتیسز' (zero-shot synthesis) کہا جاتا ہے۔ اس مصنوعی آواز کے ساتھ، دھوکے بازوں نے شادی کے حوالے سے ہونے والی گفتگو میں حصہ لیا، خاندان کے کسی رکن کا روپ دھارا اور "شادی" کو یقینی بنانے کے لیے رقم کی منتقلی کا مطالبہ کیا۔ اس یقین کے ساتھ کہ یہ درخواست ایک قابلِ اعتماد آواز سے آئی ہے، متاثرہ شخص نے رقم بھیج دی اور بعد میں اسے دھوکہ دہی کا علم ہوا۔

یہ سیکیورٹی ٹیموں کے لیے کیوں اہم ہے

آڈیو ڈیپ فیکس (Audio deepfakes) ویڈیو جعل سازی کے بعد سامنے آئے ہیں، لیکن اب ایک قابلِ یقین وائس کلون بنانا سستا اور تیز ہو گیا ہے۔ تین تکنیکی عوامل اس کی شناخت کو مشکل بناتے ہیں:

  • فون لائن کمپریشن (Phone-line compression) ان باریک آواز کے اشاروں (acoustic cues) کو ختم کر دیتی ہے جن پر فارنزک ٹولز انحصار کرتے ہیں، جس سے حقیقی اور مصنوعی آواز کے درمیان فرق دھندلا جاتا ہے۔
  • ماحول کا شور (Ambient noise) حقیقی کالز میں ان نشانات (artefacts) کو چھپا دیتا ہے جو کسی تجزیہ کار کو خبردار کر سکتے تھے۔
  • ریئل ٹائم سنتیسز (Real-time synthesis) دھوکے بازوں کو فوری جواب دینے کی اجازت دیتا ہے، جس سے پرانے ٹیکسٹ ٹو اسپیچ (text-to-speech) سسٹمز والا وقفہ ختم ہو جاتا ہے اور گفتگو قدرتی محسوس ہوتی ہے۔

اگر کوئی ادارہ اب بھی صارفین کی تصدیق اس بنیاد پر کرتا ہے کہ "آپ کی آواز کس جیسی ہے،" تو وہ بالکل اسی طرح کے حملے کا شکار ہو سکتا ہے۔

کیا خطرے میں ہے

افراد کے لیے، نقصان فوری اور ذاتی ہے—₹11.8 لاکھ۔

حفاظتی اقدامات کا طریقہ کار (Counter-measure playbook)

سیکیورٹی انجینئرز ہر آنے والی وائس اسٹریم کو ناقابلِ اعتماد سمجھ کر اور تصدیق کے مختلف مراحل شامل کر کے دفاع کو مضبوط بنا سکتے ہیں:

  • ملٹی موڈل آتھنٹیکیشن (Multimodal authentication) – آواز کو بصری اشاروں (چہرے کی شناخت) اور میٹا ڈیٹا جیسے کہ ڈیوائس فنگر پرنٹس کے ساتھ جوڑیں۔ صرف ایک مصنوعی آواز شناخت کی جانچ کے لیے کافی نہیں ہونی چاہیے۔
  • سیکنڈری چینل کنفرمیشن (Secondary-channel confirmation) – زیادہ مالیت کے معاملات کی منظوری سے پہلے پہلے سے منظور شدہ ایپ، ای میل، یا محفوظ میسجنگ پلیٹ فارم کے ذریعے دوبارہ تصدیق لازمی کریں۔
  • الگورتھمک شناخت کا ثبوت (Algorithmic identity proof) – انسانی فیصلے پر انحصار کرنے کے بجائے ویکٹر پر مبنی فیشل ایمبیڈنگز (facial embeddings) یا دیگر ریاضیاتی طور پر بنیاد رکھنے والے مماثلٹی اسکورز (similarity scores) کا استعمال کریں۔ خودکار فاصلاتی پیمانے (distance metrics) ان غلطیوں کو پکڑ سکتے ہیں جو سننے والا شاید نظر انداز کر دے۔

یہ اقدامات تصدیق کو "آواز درست لگ رہی ہے" سے بدل کر معروضی اور کراس چیک شدہ شواہد تک لے جاتے ہیں۔

آگے کیا دیکھنا چاہیے

اداروں کو کسی بھی ایسے ورک فلو کا آڈٹ کرنا چاہیے جو آواز کو شناخت کے واحد ثبوت کے طور پر قبول کرتا ہو۔ ایسے 'ٹیبل ٹاپ ایکسرسائزز' (tabletop exercises) کریں جو وائس کلوننگ حملوں کی نقل کریں، انسیڈنٹ رسپانس (incident-response) کے طریقہ کار کو اپ ڈیٹ کریں، اور ایسے ڈیٹیکشن ٹولز میں سرمایہ کاری کریں جو کمپریشن آرٹیکٹس یا آواز کے مخصوص نشانات (acoustic signatures) میں غیر معمولی تبدیلیوں کو پکڑ سکیں—یہ جانتے ہوئے کہ ایسے ٹولز صرف جزوی تحفظ فراہم کرتے ہیں۔

خلاصہ

مہاراشٹر کا یہ واقعہ ثابت کرتا ہے کہ AI سے چلنے والی وائس کلوننگ اب محض ایک نظریاتی چیز نہیں رہی؛ یہ منٹوں میں بے خبر لوگوں سے اصل رقم چھین سکتی ہے۔ وہ سیکیورٹی ٹیمیں جو ثبوت کے بغیر صرف آواز پر بھروسہ کرتی رہتی ہیں، انہیں بڑے پیمانے پر اسی طرح کے نقصان کا خطرہ ہے۔ آگے بڑھنے کا راستہ واضح ہے: متعدد اور آزادانہ تصدیقی عوامل شامل کریں اور جب تک ثابت نہ ہو جائے، ہر کال کو ممکنہ طور پر مصنوعی (synthetic) سمجھیں۔