"Friendly Fire" سیکیورٹی اسٹڈی نے دکھایا ہے کہ ایک AI ایجنٹ کو محض ایک README فائل میں نقصان دہ ہدایت شامل کر کے دھوکہ دیا جا سکتا ہے، اور ایجنٹ اصل کوڈ کو دیکھے بغیر اس کی تعمیل کر دے گا۔ یہی خامی ایک ذاتی بلاگ آٹومیشن پائپ لائن میں بھی سامنے آئی جو غیر نگرانی شدہ جنریشن مرحلے کے دوران "auto-approve" فلیگ پر انحصار کرتی تھی، جس سے ایک چھپی ہوئی حملہ آور کی سطح (attack surface) ظاہر ہو گئی۔
Friendly Fire اسٹڈی ایک چھپے ہوئے حملے کے راستے (attack vector) کو بے نقاب کرتی ہے
Friendly Fire پیپر کے پیچھے موجود محققین نے ایک معمولی مگر طاقتور ایکسپلائٹ (exploit) کا مظاہرہ کیا: ایک حملہ آور دستاویز کی فائل میں ایک کمانڈ شامل کرتا ہے جسے AI اپنے معمول کے ورک فلو کے حصے کے طور پر پڑھتا ہے۔ چونکہ ایجنٹ فائل کے مواد پر بھروسہ کرتا ہے، اس لیے وہ اس چھپی ہوئی کمانڈ کو ایک جائز ہدایت کے طور پر نافذ کرتا ہے۔ اس حملے کے لیے خود AI ماڈل کو نقصان پہنچانے کی ضرورت نہیں ہے؛ اسے صرف اس ڈیٹا پر اثر انداز ہونے کی ضرورت ہے جسے ماڈل انسانی نگرانی کے بغیر پروسیس کرتا ہے۔
اس اسٹڈی کا اہم ترین حصہ پے لوڈ (payload) کی جدت نہیں بلکہ یہ انکشاف ہے کہ "auto-approve" موڈز—ایسی سیٹنگز جو AI کو بتاتی ہیں کہ وہ بغیر کسی ثانوی چیک کے جو کچھ بھی پڑھے اس پر عمل کرے—بیرونی ڈیٹا ذرائع کے ساتھ ایک ضمنی اعتماد کا رشتہ پیدا کرتے ہیں۔ جب وہ اعتماد اندھا ہو، تو پائپ لائن کسی بھی من مانے (arbitrary) کوڈ کے نفاذ کے لیے ایک دروازہ بن جاتی ہے۔
ایک غیر نگرانی شدہ بلاگ پائپ لائن کیسے ناکام ہوئی
اسٹڈی کے مصنف نے یہی منطق ایک ذاتی بلاگ آٹومیشن سسٹم پر لاگو کی۔ ورک فلو تین مراحل پر مشتمل ہے:
- Generation stretch – AI بغیر کسی انسانی نگرانی کے آرٹیکل لکھتا ہے۔
- QA gate – ایک خودکار کوالٹی اسکور آؤٹ پٹ کا جائزہ لیتا ہے۔
- Telegram button – پوسٹ شائع کرنے کے لیے انسان کو ایک بٹن دبانا ہوتا ہے۔
Generation stretch کے دوران مصنف نے dangerously-skip-permissions نامی ایک فلیگ فعال کیا، جو AI کو بتاتا ہے کہ وہ کسی بھی ان پٹ کو منظور شدہ سمجھے۔ یہ فلیگ بنیادی طور پر Friendly Fire پیپر میں نشاندہی کیے گئے "auto-approve" موڈ کی نقل کرتا ہے۔
بعد میں کیے گئے آڈٹ نے ایک وسیع خلا کو بے نقاب کیا: اگر کوئی حملہ آور اس وقفے کے دوران AI کے پڑھے جانے والی کسی بھی فائل پر اثر انداز ہو سکتا ہے، تو وہ پورے پائپ لائن کو اپنی مرضی کے مطابق چلا سکتا ہے۔ مصنف کا اپنا سسٹم چھ میں سے پانچ بار خاموش ناکامیوں کا شکار ہوا کیونکہ ایک کنفیگریشن اسکرپٹ نے غیر ارادی طور پر دوسرے اسکرپٹ کی سیٹنگز کو اوور رائٹ کر دیا تھا۔ ایگزٹ کوڈز یا QA اسکورز کی لاگنگ نہ ہونے کی وجہ سے، یہ مسئلہ دریافت ہونے سے پہلے تین دن تک برقرار رہا۔
یہ واقعہ ثابت کرتا ہے کہ حفاظت AI کے آؤٹ پٹ پر بھروسہ کرنے سے نہیں بلکہ جنریشن مرحلے کے گرد موجود تین واضح چیک پوائنٹس سے حاصل ہوتی ہے۔
حفاظت اصل میں کہاں ہوتی ہے
اسٹڈی اور بلاگ آٹومیشن کی ناکامی ایک ہی نکتے پر ملتی ہیں: حفاظت جنریشن کے عمل سے باہر ہونی چاہیے۔ جب AI "auto-approve" حالت میں کام کرتا ہے تو اسے کسی بھی رویے پر اکسایا جا سکتا ہے؛ صرف ارد گرد کے کنٹرولز ہی غیر مطلوبہ اقدامات کا پتہ لگا سکتے ہیں اور انہیں روک سکتے ہیں۔
اہم مشاہدات:
- آخر میں انسانی منظوری اس لیے کام کرتی ہے کیونکہ یہ حتمی شاہکار (artifact) کا جائزہ لیتی ہے، نہ کہ ان درمیانی مراحل کا جو ریئل ٹائم نگرانی کے لیے بہت تیز اور بہت زیادہ ہیں۔
- کوالٹی تھریش ہولڈز جنریشن کے بعد لیکن اشاعت سے پہلے لاگو کیے جاتے ہیں، جو کم اعتماد والے آؤٹ پٹس کو پکڑ لیتے ہیں جن کے ساتھ چھیڑ چھاڑ کی گئی ہو۔
- ہر ایگزٹ کوڈ، QA اسکور اور کنفیگریشن کی تبدیلی کی جامع لاگنگ خاموش ناکامیوں کو اس سے پہلے ظاہر کر دیتی ہے کہ وہ بڑے پیمانے پر پھیل جائیں۔
auto-approve ایجنٹس چلانے والوں کے لیے اسباق
- سب کچھ لاگ کریں – ایگزٹ کوڈز، QA اسکورز اور کنفیگریشن فائلوں میں ہونے والی کسی بھی تبدیلی کو محفوظ کریں۔ آپ اسے ٹھیک نہیں کر سکتے جسے آپ دیکھ نہیں سکتے۔
- ایک سخت کوالٹی گیٹ نافذ کریں – ایک ایسا غیر قابلِ گفت و شنید (non-negotiable) تھریش ہولڈ مقرر کریں جسے پائپ لائن کے اگلے مرحلے پر جانے سے پہلے پورا کرنا ضروری ہو۔
- حتمی مرحلے کے لیے انسانی منظوری محفوظ رکھیں – AI کے جنریٹ کرنے کے دوران اسے دیکھنے کی کوشش کرنا غیر حقیقی ہے؛ تمام چیک کے بعد ایک ہی بٹن کا دبانا کہیں زیادہ قابلِ اعتماد ہے۔
- کنفیگریشن فائلوں کی حفاظت کریں – انہیں دوسرے ٹولز سے الگ رکھیں جو سیٹنگز کو دوبارہ لکھ سکتے ہیں، اور باقاعدگی سے کسی بھی رائٹ ایکسیس (write access) کا آڈٹ کریں۔
خلاصہ
غیر نگرانی شدہ AI ایجنٹ صرف اتنے ہی محفوظ ہیں جتنے آپ ان کے گرد موجود خلا کو بند کرتے ہیں۔ ایک "auto-approve" فلیگ سہولت کو ایک خاموش بیک ڈور میں بدل دیتا ہے؛ مکمل لاگنگ، سخت کوالٹی گیٹس، اور انسانی منظوری کا حتمی مرحلہ وہ عملی دفاع ہیں جو پائپ لائن کو حملے کے راستے میں بدلنے سے روکتے ہیں۔
