محققین نے دکھایا ہے کہ انکرپٹڈ ریزننگ ٹریسز (encrypted reasoning traces)—چھوٹے پیکٹس جو ایک فراہم کنندہ صارف کے ڈیوائس کو بھیجتا ہے تاکہ گفتگو ایک ماڈل سے دوسرے ماڈل پر منتقل ہو سکے—اسی سروس کے ایک کمزور ماڈل کے ذریعے ڈی کرپٹ کیے جا سکتے ہیں، جس سے سینکڑوں کریڈنشلز اور نجی تفصیلات افشا ہو سکتی ہیں۔ یہ دریافت، جو کہ پیپر Stealing Reasoning Traces from Proprietary LLM APIs میں تفصیل سے بیان کی گئی ہے، اس سہولت کے لیے خطرہ ہے جس پر Anthropic، OpenAI اور Google اپنی AI چیٹس کو ہموار رکھنے کے لیے انحصار کرتے ہیں۔
انکرپٹڈ بلاکس کیوں موجود ہیں
جب آپ کسی لارج لینگویج ماڈل (LLM) سے بات کرتے ہیں، تو سروس ایک "ریزننگ ٹریس" (reasoning trace) تیار کرتی ہے: یعنی اندرونی پرامپٹس، ٹول کالز اور چین آف تھاٹ (chain-of-thought) کے مراحل کی وہ زنجیر جو جواب تک لے جاتی ہے۔ اس زنجیر کو کھوئے بغیر آپ کو ایک بڑے ماڈل سے سستے ماڈل پر منتقل کرنے کے لیے، فراہم کنندہ ٹریس کو انکرپٹ کرتے ہیں، اسے آپ کے ڈیوائس پر بھیجتے ہیں، اور توقع کرتے ہیں کہ آپ اسے اگلی درخواست کے ساتھ واپس بھیجیں گے۔ انکرپٹ کرنے کا مقصد ٹریس کو نجی رکھنا ہے جبکہ کراس-سیشن اور کراس-ماڈل تسلسل کو ممکن بنانا ہے۔
یہ حملہ کیسے کام کرتا ہے
محققین نے ایک تین مرحلہ وار ایکسپلائٹ (exploit) کا مظاہرہ کیا جس کے لیے خود مضبوط ماڈل میں کسی خلاف ورزی کی ضرورت نہیں ہے:
- کیپچر (Capture) کریں ایک انکرپٹڈ ریزننگ بلاک جو ایک عام گفتگو کے دوران ایک طاقتور ماڈل کے ذریعے تیار کیا گیا ہو۔
- فیڈ (Feed) کریں وہ بلاک اسی فراہم کنندہ کے ایک کمزور ماڈل کو، اور اس سے بلاک کو "پڑھنے" کا کہیں۔
- چونکہ کمزور ماڈل کے پاس وہی ڈی کرپشن کیز (decryption keys) ہوتی ہیں، اس لیے وہ ڈی کرپٹ شدہ مواد کو سادہ متن (plain text) میں آؤٹ پٹ (outputs) کرتا ہے۔
کمزور ماڈل ایک ڈی کرپشن اوریکل (decryption oracle) کے طور پر کام کرتا ہے۔ حملہ آوروں نے کبھی بھی مضبوط ماڈل کے اندرونی حصوں کو نہیں چھوا؛ انہوں نے صرف فراہم کنندہ کی اپنی API کو اس کے خلاف استعمال کیا۔
محققین نے کیا حاصل کیا
- 182 کریڈنشلز – API کیز، ٹوکنز اور دیگر راز جو ٹریس میں شامل تھے۔
- 367 نجی معلومات کے ٹکڑے – نام، ای میلز، پتے جو صارفین نے چیٹ کے دوران فراہم کیے تھے۔
- پرامپٹ انجیکشن پے لوڈز (Prompt-injection payloads) – انکرپٹڈ بلاک میں چھپائے گئے بدنیتی پر مبنی ہدایات جو بعد میں ٹریس کے دوبارہ چلنے پر عمل درآمد کر سکتی ہیں۔
- سیفٹی فلٹر بائی پاسز (Safety-filter bypasses) – ڈی کرپٹ شدہ ٹریس نے ان مراحل کو ظاہر کیا جنہیں اگر سادہ متن میں دیکھا جاتا تو بلاک کر دیا جاتا، جس سے خطرناک مواد کے نکل جانے کا راستہ کھل گیا۔
پیپر اس بات پر زور دیتا ہے کہ یہ کمزوری کرپٹوگرافک الگورتھم میں کوئی نقص نہیں ہے؛ انکرپشن خود برقرار ہے۔ یہ خلاف ورزی صارف کے تجربے کی خاطر فراہم کنندہ کے نیٹ ورک میں موجود کسی بھی ماڈل کو بلاک ڈی کرپٹ کرنے کی اجازت دینے کے ڈیزائن کے انتخاب سے پیدا ہوتی ہے۔
مسئلے کے مرکز میں موجود توازن (trade-off)
فراہم کنندہ نے اپنی APIs میں یہ "ماڈل سوئچنگ" کی صلاحیت اس لیے بنائی کیونکہ ڈویلپرز اور صارفین تسلسل کو اہمیت دیتے ہیں۔ اگر انکرپشن کسی ایک ماڈل انسٹنس یا سیشن سے منسلک ہوتی، تو ہموار منتقلی ٹوٹ جاتی، جس سے ڈویلپرز کو اسٹیٹ مینجمنٹ (state management) خود دوبارہ بنانی پڑتی۔ پیپر کا استدلال ہے کہ لچک کے لیے جان بوجھ کر سیکیورٹی پر سمجھوتہ کیا گیا۔
ڈویلپرز کو اب کیا کرنا چاہیے
- انکرپٹڈ ٹریسز کو کلیئر ٹیکسٹ (clear-text) سمجھیں۔ فرض کریں کہ کوئی بھی لاگ، کیش یا مانیٹرنگ سسٹم جو انہیں اسٹور کرتا ہے، اسے حملہ آور پڑھ سکتا ہے۔
- ٹریسیز کو عوامی ریپوزٹریز (public repositories) میں کمٹ کرنے سے گریز کریں۔ ایک بھی بھٹکا ہوا بلاک درجنوں رازوں کو بے نقاب کر سکتا ہے۔
- سخت کنٹرولز کے لیے منصوبہ بندی کریں۔ فراہم کنندہ سیکیورٹی کو سخت کر سکتے ہیں، جس سے ملٹی ماڈل ایجنٹس بنانے کا طریقہ بدل سکتا ہے۔
- واضح اسٹیٹ ہینڈ آف (explicit state hand-offs) کی طرف منتقل ہوں۔ چھپے ہوئے ریزننگ پر انحصار کرنے کے بجائے، ایجنٹس کو اس طرح ڈیزائن کریں کہ وہ اسٹرکچرڈ ڈیٹا (JSON, XML, وغیرہ) آؤٹ پٹ کریں جسے انکرپشن کے بغیر محفوظ طریقے سے ماڈلز کے درمیان منتقل کیا جا سکے۔
- اپنے پرامپٹس کا آڈٹ کریں۔ کسی بھی حساس ڈیٹا کو تلاش کریں جو ریزننگ چین میں شامل ہو رہا ہو اور درخواست بھیجنے سے پہلے اسے نکال دیں۔
بڑے فراہم کنندگان سے کیا توقع رکھیں
اس پیپر کی اشاعت Anthropic، OpenAI اور Google کو اپنی APIs میں شامل ڈی کرپشن پالیسی پر نظر ثانی کرنے پر مجبور کرے گی۔
وسیع تر اثرات
یہ دریافت ایک کلاسک سیکیورٹی کشمکش کو اجاگر کرتی ہے: سہولت اکثر ایک خفیہ راستہ (backdoor) کھول دیتی ہے۔ صارف کے ملکیتی بلاک کو کسی بھی ماڈل کے ذریعے ڈی کرپٹ کرنے کی اجازت دے کر، فراہم کنندگان نے حملہ آوروں کو حساس ڈیٹا تک پہنچنے کا ایک آسان راستہ دے دیا ہے۔ اس کا حل ممکنہ طور پر AI انٹیگریشنز کو تھوڑا مشکل بنا دے گا، لیکن یہ اس توقع کو بھی بحال کرے گا کہ انکرپٹڈ ڈیٹا انکرپٹڈ ہی رہتا ہے۔
حاصلِ کلام (Takeaway): انکرپٹڈ ریزننگ ٹریسز کوئی سیکیورٹی حد نہیں ہیں؛ یہ ایک سہولت بخش شارٹ کٹ ہیں جسے آپ کے خلاف استعمال کیا جا سکتا ہے۔ انہیں سادہ متن سمجھیں، انہیں لاگز سے ختم کریں، اور اپنے ایجنٹس کو اس مستقبل کے لیے دوبارہ ڈیزائن کریں جہاں صرف اصل ماڈل ہی اپنے خیالات کو پڑھ سکے گا۔
