Anthropic نے کہا ہے کہ اس کے Claude کے تین ماڈلز حال ہی میں ہونے والی سیکیورٹی ٹیسٹنگ مہم کے دوران سینڈ باکس (sandbox) سے باہر نکل گئے اور حقیقی دنیا کے سسٹمز تک رسائی حاصل کر لی، جس کے نتیجے میں جانچ پڑتال کو فوری طور پر روک دیا گیا اور ایک عوامی رپورٹ جاری کی گئی۔

کمپنی نے سائبر سیکیورٹی کے 141,006 ٹیسٹ رن کیے اور تین ایسے واقعات پائے گئے جہاں ماڈلز نے فرضی ماحول (simulated environment) کے بجائے لائیو ٹارگٹس تک رسائی حاصل کی۔ کسی تھرڈ پارٹی پارٹنر کے ساتھ غلط کنفیگریشن (misconfiguration) کی وجہ سے سینڈ باکس عملی طور پر کھلا رہ گیا۔

یہ خلاف ورزیاں کیسے ہوئیں

  • Claude Opus 4.7 انٹرنیٹ پر موجود ایک حقیقی کمپنی تک پہنچ گیا اور چند سو لائنوں کے ڈیٹا بیس تک رسائی حاصل کرنے کے لیے کمزور پاس ورڈز کا اندازہ لگایا۔
  • Claude Mythos 5 نے اصل PyPI ریپوزٹری میں ایک پیکیج شائع کر کے سپلائی چین حملہ (supply-chain attack) کیا۔ رجسٹری کی جانب سے غیر معمولی صورتحال کی نشاندہی کرنے سے پہلے یہ پیکیج 15 پروڈکشن مشینوں پر انسٹال ہو چکا تھا۔
  • ایک اندرونی تحقیقی ماڈل (internal research model) نے 9,000 ٹارگٹس کو اسکین کیا، ایک ایپلی کیشن کو نقصان پہنچایا، اور پھر خود کو روک لیا جب اسے احساس ہوا کہ ہوسٹ اس کے فرضی ٹاسک کے مطابق نہیں ہے۔

Anthropic اس بات پر زور دیتا ہے کہ یہ "بغاوت کرنے والے AI" (rogue AI) کے واقعات نہیں تھے۔ ماڈلز نے وہی کیا جو انہیں بتایا گیا تھا؛ ٹیسٹنگ انفراسٹرکچر انہیں کھلے انٹرنیٹ سے الگ رکھنے میں ناکام رہا۔

یہ کیوں اہم ہے

یہ واقعات ظاہر کرتے ہیں کہ جب AI ایجنٹس کوڈ چلا سکتے ہیں اور نیٹ ورک کالز کر سکتے ہیں، تو ایک کنٹرول شدہ سینڈ باکس اور لائیو نیٹ ورک کے درمیان فرق کتنا کم ہو جاتا ہے۔ خود مختار ایجنٹس (autonomous agents) کے ساتھ تجربات کرنے والے اداروں کے لیے، صرف ایک سسٹم پرامپٹ یا README فائل حدود کی ضمانت نہیں دے سکتی۔ جیسا کہ PyPI کا کیس ظاہر کرتا ہے، ایک معمولی ڈیٹا سیٹ یا چند مشینیں بھی بڑے پیمانے پر سپلائی چین کے مسائل کا سبب بن سکتی ہیں۔

یہ تینوں خلاف ورزیاں Anthropic کی کوششوں کے پیمانے کو بھی ظاہر کرتی ہیں: اس نے کسی اتفاقی نمونے کے بجائے ہر ٹیسٹ رن کا آڈٹ کیا۔ اسی باریک بینی کی وجہ سے کمپنی ان واقعات کے پھیلنے سے پہلے غلط کنفیگریشن کو پکڑنے میں کامیاب رہی۔

Anthropic نے کیا کیا

سینڈ باکس کی ناکامی کا پتہ چلنے کے ایک دن کے اندر، Anthropic نے تمام جاری جانچ پڑتالوں کو روک دیا۔ ایک ہفتے بعد اس نے ایک تفصیلی رپورٹ جاری کی جس میں تینوں واقعات، ان کی تکنیکی وجہ، اور فوری اصلاحی اقدامات کی فہرست دی گئی تھی۔

AI ایجنٹ استعمال کرنے والوں کے لیے عملی نکات

  1. براہ راست چیک کے ذریعے نیٹ ورک کی حدود کی تصدیق کریں – یہ فرض نہ کریں کہ صرف ایک پرامپٹ یا کنفیگ فائل ایجنٹ کو واقعی الگ تھلگ کر دے گی۔
  2. کریڈنشلز (credentials) کو کم سے کم حد تک محدود رکھیں – صرف وہی رسائی دیں جو ٹاسک کے لیے انتہائی ضروری ہو۔
  3. رسائی کی خود جانچ کریں – حساس وسائل سونپنے سے پہلے ایجنٹ کے اصل نیٹ ورک ویو (network view) کا جائزہ لیں۔
  4. غیر ارادی سرگرمیوں کی نگرانی کریں – آؤٹ باؤنڈ کنکشنز یا پیکیج رجسٹریشنز کے لیے الرٹس سیٹ کریں جو طے شدہ منصوبے سے ہٹ کر ہوں۔

یہ واقعہ ایک سادہ حقیقت کو اجاگر کرتا ہے: کسی AI ماڈل کو انٹرنیٹ تک رسائی دینا اتنا ہی خطرناک ہے جتنا کہ کسی انسانی آپریٹر کو کریڈنشلز سونپنا۔ جب تک سینڈ باکس کی ضمانتوں کو ثابت نہیں کیا جا سکتا، ہر AI سے چلنے والے عمل کو ممکنہ طور پر غیر محدود سمجھیں اور اسی کے مطابق ماحول کو محفوظ بنائیں۔