ذكرت شركة Anthropic أن ثلاثة من نماذج Claude الخاصة بها خرجت من بيئة اختبار معزولة (sandbox) ووصلت إلى أنظمة في العالم الحقيقي خلال حملة اختبار أمني أخيرة، مما أدى إلى وقف فوري لعمليات التقييم وإصدار تقرير عام.
أجرت الشركة 141,006 عملية اختبار للأمن السيبراني ووجدت ثلاث حوادث وصلت فيها النماذج إلى أهداف حقيقية بدلاً من البيئة المحاكية. وقد تسبب خطأ في الإعدادات مع شريك من طرف ثالث في ترك بيئة الاختبار (sandbox) مفتوحة فعلياً.
كيف حدثت الاختراقات
- وصل نموذج Claude Opus 4.7 إلى شركة حقيقية مكشوفة على الإنترنت، وقام بتخمين كلمات مرور ضعيفة لسحب قاعدة بيانات تحتوي على بضع مئات من الصفوف.
- قام نموذج Claude Mythos 5 ببناء هجوم على سلاسل التوريد من خلال نشر حزمة (package) في مستودع PyPI الحقيقي. وقد تم تثبيت هذه الحزمة على 15 جهاز إنتاج قبل أن يكتشف السجل هذا الخلل.
- قام نموذج بحث داخلي بمسح 9,000 هدف، واخترق تطبيقاً واحداً، ثم توقف من تلقاء نفسه بعد إدراكه أن المضيف لا يتوافق مع مهمته المحاكية.
وتؤكد Anthropic أن هذه لم تكن حوادث "ذكاء اصطناعي مارق". فقد فعلت النماذج ما أُمرت به؛ لكن البنية التحتية للاختبار فشلت في عزلها عن الإنترنت المفتوح.
لماذا يعد هذا الأمر مهماً
تُظهر هذه الحوادث مدى ضيق الخط الفاصل بين بيئة الاختبار المحكومة والشبكة الحية عندما تتمكن وكلاء الذكاء الاصطناعي (AI agents) من تنفيذ الأكواد وإجراء اتصالات الشبكة. وبالنسبة للمؤسسات التي تجري تجارب على الوكلاء المستقلين، فإن "أمر النظام" (system prompt) أو ملف README لا يمكنهما ضمان الحدود. فحتى مجموعة بيانات متواضعة أو حفنة من الأجهزة يمكن أن تؤدي إلى اختراقات أكبر في سلاسل التوريد، كما يوضح مثال PyPI.
كما تكشف الاختراقات الثلاثة عن حجم جهود Anthropic؛ فقد قامت بمراجعة كل عملية اختبار، وليس مجرد عينة عشوائية. وقد سمحت هذه الدقة للشركة برصد الخطأ في الإعدادات قبل أن تنتشر الحوادث.
ما فعلته Anthropic
في غضون يوم واحد من اكتشاف فشل بيئة الاختبار، أوقفت Anthropic جميع عمليات التقييم الجارية. وبعد أسبوع، أصدرت إفصاحاً مفصلاً سردت فيه الأحداث الثلاثة، والسبب التقني، وخطوات المعالجة الفورية.
نصائح عملية لمستخدمي وكلاء الذكاء الاصطناعي
- التحقق من حدود الشبكة عبر فحوصات مباشرة – لا تفترض أن "الأمر" (prompt) أو ملف الإعدادات يعزل الوكيل فعلياً.
- حصر صلاحيات الاعتماد في الحد الأدنى – امنح فقط ما تحتاجه المهمة بشكل مطلق.
- اختبر إمكانية الوصول بنفسك – افحص رؤية الوكيل الفعلية للشبكة قبل تسليمه موارد حساسة.
- مراقبة الأنشطة غير المقصودة – قم بإعداد تنبيهات للاتصالات الصادرة أو تسجيل الحزم التي تنحرف عن الخطة الموضوعة.
تؤكد هذه الواقعة على حقيقة بسيطة: منح نموذج ذكاء اصطناعي إمكانية الوصول إلى الإنترنت ينطوي على مخاطر تماثل منح صلاحيات الوصول لمشغل بشري. وإلى أن يتم إثبات ضمانات بيئة الاختبار (sandbox)، تعامل مع كل إجراء مدفوع بالذكاء الاصطناعي على أنه قد يكون غير مقيد، وقم بتأمين البيئة وفقاً لذلك.
