أطلقت OpenAI اليوم GPT-Red، وهو نموذج لغوي كبير يعمل كمخترق آلي للفريق الأحمر (red-team). يقوم النظام بالفعل بتحصين أحدث نماذج الشركة GPT-5.6، مما أدى إلى خفض معدل نجاح الهجمات المحاكية من أكثر من 90% إلى أقل من 23%.
كيف يقوم GPT-Red بأتمتة عمل الفريق الأحمر
لقد اعتمد اختبار الفريق الأحمر — وهو محاولة متعمدة لكسر النظام أو اختطافه — تقليديًا على خبراء الأمن. ومع تعلم النماذج اللغوية الكبيرة (LLMs) كيفية تصفح الويب، وتشغيل الأكواد، واستدعاء خدمات الطرف الثالث، تتضاعف طرق إساءة استخدامها بسرعة أكبر مما يمكن لفريق بشري استكشافه.
ردت OpenAI من خلال "حلقة لعب ذاتي" (self-play loop) تضع نسخة من النموذج في مواجهة نسخة أخرى داخل بيئة محاكاة يطلق عليها الباحثون اسم dojo. في هذه البيئة التجريبية (sandbox)، يتخذ GPT-Red دور المهاجم بينما تحاول نسخة أو أكثر من نماذج المدافع المقاومة. يخوض الطرفان جولات لا حصر لها؛ حيث تجبر كل تكرار المهاجم على كشف عيوب أكثر دقة، وتجبر المدافع على تعلم دفاعات جديدة. وقد دمجت OpenAI هذه العملية في مسار التدريب الذي أنتج GPT-5.6، والذي تروج له الشركة باعتباره إصدارها الأكثر قوة حتى الآن.
فئة جديدة من الهجمات: سلسلة الأفكار المزيفة
كشفت عمليات اللعب الذاتي عن هجوم لافت يُعرف باسم "سلسلة الأفكار المزيفة" (fake chain of thought). غالبًا ما تُصدر النماذج اللغوية الكبيرة مسار استدلال خطوة بخطوة — "سلسلة أفكار" — يوجه الإجابة النهائية. تعلم GPT-Red إدراج مدخلات زائفة في ذلك المسار، مما يجعل النموذج يعتقد أنه قد تحقق بالفعل من مقدمات خاطئة. على سبيل المثال، يمكن للمهاجم إقناع النموذج بأن "1 + 1 = 3" قد تم التحقق منها، مما يدفع النظام إلى إنتاج مخرجات بناءً على النتيجة المفبركة.
لا يقتصر هذا الهجوم على مولدات النصوص البحتة. ففي اختبار ضد "Vendy"، وهو وكيل (agent) بأسلوب آلة البيع الذاتي طوره مختبر خارجي، تلاعب GPT-Red بحقول الأسعار وألغى الطلبات، مما أثبت أن التقنية تعمل ضد الوكلاء المتخصصين الذين يعملون بناءً على أوامر المستخدم.
تحسن أمني ملموس
أصدرت OpenAI أرقامًا تظهر تأثير التدريب ضد GPT-Red. فعند تشغيل أقوى الهجمات التي أنتجها النموذج الجديد ضد GPT-5 (إصدار أغسطس)، نجحت أكثر من 90%. بينما نجحت الهجمات نفسها ضد GPT-5.6 في أقل من 23% من الحالات.
في تجربة أجريت عام 2025 وضعت GPT-Red في مواجهة خبراء الفريق الأحمر البشريين، اكتشف الذكاء الاصطناعي تنويعات الهجمات وصقلها بكفاءة أكبر من البشر، مما يشير إلى أن النموذج الخصمي (adversarial model) يمكنه استكشاف شريحة أوسع من مساحة الثغرات في وقت أقل.
الحدود والحاجة المستمرة للخبرة البشرية
لا يحل GPT-Red محل محللي الأمن البشريين. إذ لا يزال يتعثر في الهجمات الحوارية متعددة الأدوار، حيث يبني المهاجم سردًا عبر عدة تبادلات، وفي هجمات حقن الأوامر المرئية (visual prompt injections) التي تخفي نصوصًا خبيثة داخل الصور. تخطط OpenAI لاستخدام النموذج كمسبار للخط الأول، لاستخراج أفكار هجوم واعدة ليقوم الخبراء البشريون بالتحقيق فيها وتطويرها.
تظل الأداة مملوكة للشركة، لذا لا يمكن للباحثين الخارجيين اختبار قدراتها مباشرة أو التحقق من المكاسب المعلنة.
