اكتشفتُ أن مقياساً واحداً لبوابة الأمان قد أخفى انقطاعاً استمر يوماً كاملاً في ميزة الشرح المُنشأة بواسطة الذكاء الاصطناعي. فمن خلال معاملة "رفض البوابة" و"فشل تحميل النموذج" كشيء واحد، أعطى المقياس شعوراً زائفاً بصحة النظام. لقد سجل العداد أربعة حالات رفض وصفر حالات نجاح، ومع ذلك لم يعمل النموذج أبداً خلال تلك الفترة — وهو خطأ كان من الممكن أن يترك المشغلين غافلين عن نظام معطل.
كيف حدث هذا الالتباس
تستخدم هذه الميزة نموذجاً لغوياً محلياً لتحويل منطق الآلة الخام إلى جمل مفهومة للبشر. وتقوم بوابة أمان في مرحلة لاحقة (downstream) بحظر أي مخرجات تنتهك القواعد المحددة مسبقاً. في بيئة الإنتاج، قمتُ بتفعيل عداد واحد يزداد كلما رفضت البوابة جملة ما. وعندما سجلت الطائرة بدون طيار أربعة شروحات من الذكاء الاصطناعي، أبلغ العداد عن أربع حالات رفض وعدم وجود أي مخرجات ناجحة. اعتبرتُ ذلك دليلاً على أن البوابة تقوم بعملها، وليس دليلاً على تعطل الميزة.
ما أخفاه العداد كان فشلاً ذا مرحلتين:
- النموذج لا يعمل – يتشارك النموذج في نفس الجهاز مع بقية النظام. ولتوفير الذاكرة، يقوم المضيف بإلغاء تحميله بعد فترة من الخمول.
- انتهاء المهلة عند إعادة التحميل – عندما ظهر تهديد جديد، حاول النظام إعادة تحميل ما يقرب من اثنين جيجابايت من بيانات النموذج. تجاوزت عملية إعادة التحميل مهلة الاستجابة البالغة ثلاثين ثانية، مما أدى إلى انتهاء مهلة الطلب وعودة إجابة فارغة.
ولأن العداد عامل "رفض البوابة" و"الإجابة الفارغة الناتجة عن انتهاء المهلة" كحدث واحد، أظهرت لوحة البيانات "بوابة أمان تعمل" بينما كانت ميزة الذكاء الاصطناعي معطلة فعلياً.
لماذا يهم هذا الأمر
في المنتجات القائمة على الذكاء الاصطناعي، تمنع بوابات الأمان المخرجات الضارة أو غير المنطقية. ويراقب المشغلون معدل تفعيل البوابة كإشارة لصحة النظام. وعندما تندمج هذه الإشارة مع أنماط فشل غير ذات صلة، يصبح المقياس كذبة صامتة: فهو يطمئن المستخدم بينما الخدمة غير متاحة.
الإصلاح الذي أعاد الوضوح
أجريتُ ثلاثة تغييرات عملية:
- إبقاء النموذج في الذاكرة – قمت بتعديل المضيف للاحتفاظ بالنموذج في الذاكرة، مما ألغى تأخير إعادة التحميل.
- تمديد مهلة الانتظار – رفعت نافذة الاستجابة للتعامل مع حالات التحميل البطيئة العارضة.
- تقسيم العداد – استبدلت مقياس "مرفوض بواسطة البوابة" الواحد بأربعة عدادات متميزة: مقبولة، مرفوضة، استجابة فارغة، ولا توجد إجابة.
كانت الخطوة الثالثة هي الحاسمة. فبدلاً من رقم واحد يمكن تفسيره بطريقتين، يوضح التقسيم الرباعي ما إذا كانت بوابة الأمان نشطة، أو ما إذا كان النموذج يجيب، أو ما إذا كان الطلب لم يصل إلى النموذج على الإطلاق.
المقايضات والحجج المضادة
ما يجب مراقبته لاحقاً
يجب على المطورين الذين يطلقون مكونات الذكاء الاصطناعي تدقيق أي عدادات مجمعة تدمج فحوصات الأمان مع إخفاقات على مستوى النظام. إن بناء سجل تاريخي مفصل يسجل مسار كل طلب — بدء تحميل النموذج، تقييم البوابة، والنتيجة النهائية — يوفر البيانات الاستقصائية اللازمة لرصد المشكلات الخفية.
الخلاصة: يمكن لمقياس واحد لـ "رفض البوابة" أن يخفي خدمة ذكاء اصطناعي معطلة؛ إن تقسيم هذا المقياس إلى أحداثه المكونة يكشف الحقيقة ويمنع الثقة الزائفة في نظام لا يعمل فعلياً.
