نموذج Opus 5 من Anthropic يحقق نسبة نجاح 0% في هجمات حقن الأوامر عبر المتصفح
حققت Anthropic طفرة هائلة في أمن الذكاء الاصطناعي مع إطلاق Opus 5، مما قد يساهم في حل واحدة من أكثر الثغرات استمراراً في الوكلاء المستقلين (autonomous agents). ومن خلال تطبيق نظام دفاع ثنائي الطبقات، أظهر النموذج حصانة شبه كاملة ضد هجمات حقن الأوامر (prompt injection) القائمة على المتصفح.
أزمة حقن الأوامر في وكلاء الذكاء الاصطناعي
لا يزال حقن الأوامر يمثل "كعب أخيل" في عصر الذكاء الاصطناعي الحالي. وتحدث هذه الثغرة عندما يقوم المهاجم بإخفاء تعليمات خبيثة داخل صفحة ويب — غالباً عبر نص غير مرئي — يقرأها وكيل الذكاء الاصطناعي أثناء التصفح. وبمجرد معالجة هذه التعليمات، يمكنها اختطاف النموذج، وإجباره على تجاوز بروتوكولات السلامة أو تنفيذ إجراءات غير مصرح بها. وبينما اقترح قادة الصناعة مثل OpenAI سابقاً أن حقن الأوامر قد يكون خللاً متأصلاً لا يمكن حله في النماذج اللغوية الكبيرة (LLMs)، فإن أحدث بيانات Anthropic تتحدى هذه النظرة المتشائمة.
تحقيق معيار النسبة الصفرية
وفقاً لبطاقة النظام (system card) الخاصة بـ Anthropic، حقق Opus 5 نسبة نجاح هجوم مذهلة بلغت 0% عبر 129 سيناريو اختبار مختلفاً صُممت خصيصاً لوكلاء المتصفح. ويمثل هذا قفزة نوعية مقارنة بالإصدارات السابقة. وفي اختبارات حقن الأوامر العامة التي أجرتها شركة الأمن Gray Swan، أظهر Opus 5 تحسناً كبيراً مقارنة بسلفه؛ فبعد 15 محاولة، انخفض معدل نجاح المهاجم من 5.5% (كما لوحظ في Opus 4.8) إلى 2.0% فقط.
يضع هذا الأداء Opus 5 في قمة معيار Gray Swan IPI، متفوقاً على نماذج رفيعة المستوى أخرى مثل Mythos 5 (بنسبة 2.6%) و Fable 5 (بنسبة 2.8%).
السر وراء ذلك: الوضع التلقائي (Auto Mode) والدفاع ثنائي الطبقات
لا يعود هذا الاختراق إلى ذكاء النموذج وحده، بل إلى تكامله مع برمجيات متخصصة. ترتبط نسبة النجاح "الصفرية" تحديداً باستخدام Auto Mode في منتجات مثل Claude Cowork. وتستخدم Anthropic بنية دفاعية متطورة ثنائية الطبقات لتأمين الوكيل:
- مسح ما قبل المعالجة (Pre-processing Scan): تقوم طبقة مخصصة بمسح جميع البيانات الواردة بحثاً عن تعليمات مخفية أو تلاعبية قبل أن يقوم النموذج اللغوي الكبير (LLM) الأساسي بمعالجة النص.
- حظر التنفيذ (Execution Blocking): تراقب طبقة ثانوية الإجراءات التي ينوي الوكيل القيام بها، مما يؤدي إلى حظر أي أوامر خطيرة قبل تنفيذها في بيئة المتصفح.
ومن المثير للاهتمام أن البيانات تظهر أن النموذج وحده ليس حلاً سحرياً. فبدون طبقات البرمجيات الواقية هذه، تبلغ نسبة ثغرات Opus 5 حوالي 3.7%. وفي الواقع، يؤدي نموذج Sonnet 5 المتخصص أداءً أفضل قليلاً عند عزله بنسبة نجاح تبلغ 0.93%. إن التآزر بين النموذج الأساسي وحزمة البرمجيات الدفاعية هو ما يدفع عتبة الأمن إلى مستوى يقترب من الكمال.
لماذا يهم هذا مستقبل الذكاء الاصطناعي
بالنسبة للمطورين والمؤسسين الذين يبنون وكلاء ذكاء اصطناعي مستقلين، يعد هذا التطور تحولاً جذرياً. فإذا كان من الممكن تحييد حقن الأوامر من خلال الطبقات الهيكلية بدلاً من مجرد تدريب النموذج، فإن الطريق نحو سير عمل "وكيل" (agentic) موثوق — حيث يدير الذكاء الاصطناعي رسائل البريد الإلكتروني والمتصفحات والبيانات الحساسة — يصبح أكثر أماناً بكثير. لقد قدمت Anthropic مخططاً لكيفية تجاوز الصناعة لسردية "المشكلة غير القابلة للحل" نحو استقلالية ذكاء اصطناعي قوية وجاهزة للإنتاج.
النقاط الرئيسية
- أمن رائد في الصناعة: حقق Opus 5 نسبة نجاح 0% في 129 سيناريو لحقن الأوامر عبر المتصفح عند استخدام Auto Mode.
- الدفاع المتعمق (Defense-in-Depth): يتم تحقيق الأمن من خلال نهج ثنائي الطبقات يتضمن مسح البيانات قبل المعالجة والحظر الاستباقي للإجراءات.
- السيادة في المعايير: يتصدر Opus 5 معيار Gray Swan IPI، مما يقلل بشكل كبير من معدل نجاح المهاجم مقارنة بالإصدارات السابقة من النموذج.
