أطلقت Google DeepMind مشروعاً تجريبياً يستخدم التقييم المرجعي التشفيري مزدوج التعمية (cryptographic double-blind benchmarking) لتقييم نماذج Gemini Flash Lite الخاصة بها دون الكشف عن مطالبات الاختبار (test prompts) أو أوزان النموذج (model weights). يتم إجراء التقييم داخل Confidential Space التابع لـ Google Cloud، بحيث لا يرى المُقيّم النموذج أبداً، ولا يرى النموذج الأسئلة أبداً—وهو نهج قد يعيد المصداقية لتقارير أداء الذكاء الاصطناعي.
لماذا يمثل تلوث التقييم المرجعي أمراً مهماً
إذا تدرّب النموذج على بيانات تظهر لاحقاً في تقييم مرجعي، فإن درجته تتوقف عن قياس القدرة على الاستنتاج وتتحول إلى مجرد حفظ. لذا، فإن النتيجة المثالية في اختبار ملوث لا تخبرنا شيئاً عن القدرة الحقيقية. واجه الباحثون لفترة طويلة مفارقة: فإما أن يسلموا بيانات الاختبار لمزود النموذج للتحقق من التقييم المرجعي، مما يخاطر بالكشف المبكر عن البيانات، أو يرفضوا الوصول الخارجي لحماية الأوزان المملوكة لهم، مما يترك عملية التدقيق غير مؤكدة. ويظهر التأخير الأخير في تقييم Fable 5 من Anthropic على مقياس ARC-AGI كيف يمكن لسياسات الاحتفاظ بالبيانات الصارمة أن تعيق التقييم المستقل.
حل تشفيري
يستبدل المشروع التجريبي العقود القانونية ووعود "عدم تسجيل البيانات" (zero-logging) بضمانة تقنية. يقوم Confidential Space بإنشاء بيئة معزولة عتادياً (hardware-isolated enclave) تشغل نموذج Gemini Flash Lite. يقوم المُقيّم برفع مجموعة الاختبار، والتي تقوم البيئة المعزولة بختمها في "صندوق" تشفيري لا يمكن للنموذج فتحه. وفي الوقت نفسه، تظل أوزان النموذج مشفرة داخل البيئة المعزولة، وغير مرئية للمُقيّم. وتنتج البيئة المعزولة إثباتاً رياضياً بأن النموذج لم يصل أبداً إلى المطالبات أثناء عملية الاستدلال (inference). والنتيجة هي عملية تشغيل مزدوجة التعمية حقاً: حيث يحتفظ كلا الطرفين بأسراره بينما يتلقى طرف ثالث مقياس أداء يمكن التحقق منه.
من المستفيد؟
- المنظمون والمُدققون يمكنهم الآن المطالبة بأدلة على القدرة دون إجبار المزودين على الكشف عن أسرارهم التجارية.
- الشركات في مجالات الأمن السيبراني، أو الدفاع، أو أي مجال يتعامل مع بيانات مصنفة يمكنها اختبار أدوات الذكاء الاصطناعي دون المخاطرة بتسريب البيانات.
- مطورو النماذج يحافظون على ميزتهم التنافسية؛ فلم يعودوا بحاجة للاختيار بين الانفتاح والحماية.
إذا توسع هذا النهج، فقد يصبح الطريقة الافتراضية لاعتماد النماذج الرائدة، مما ينقل الصناعة من الترتيبات القائمة على الثقة إلى الضمانات القائمة على الرياضيات.
نقاط الاحتكاك المحتملة
يعتمد النظام على حزمة الحوسبة السرية (confidential computing stack) من Google Cloud، لذا قد تواجه المؤسسات التي تفضل مزودي سحابة آخرين عقبات في التكامل. كما أن تشغيل النماذج داخل بيئة معزولة (enclave) يضيف تأخراً (latency) ويحد من المسرعات العتادية المتاحة، مما قد يؤثر على درجات التقييم المرجعي. أيضاً، وبينما يضمن الإثبات التشفيري أن النموذج لم يرَ المطالبات، فإنه لا يمنع التلاعبات الأخرى، مثل الضبط الدقيق (fine-tuning) بعد بدء الاختبار. قد يجادل النقاد بأن الحل يعالج فقط جزءاً ضيقاً من مشكلة القابلية للتكرار (reproducibility) الأوسع نطاقاً.
ما الذي يجب مراقبته لاحقاً
- الاعتماد لما بعد المشروع التجريبي – قد تقوم مختبرات ذكاء اصطناعي أخرى ومزودو خدمات سحابية ببناء بيئات معزولة متوافقة، لاختبار ما إذا كان يمكن تدقيق النموذج عبر المنصات المختلفة.
- الهيئات الواضعة للمعايير – يمكن لمجموعات سلامة الذكاء الاصطناعي تقنين عمليات التدقيق التشفيرية مزدوجة التعمية كجزء من أطر الاعتماد.
- مقايضات الأداء – ستكشف عمليات تشغيل التقييم المرجعي في العالم الحقيقي عما إذا كان العبء الإضافي للتنفيذ السري مقبولاً بالنسبة للنماذج واسعة النطاق.
الخلاصة
من خلال إغلاق كل من بيانات الاختبار والنموذج داخل بيئة تشفيرية معتمة متبادلاً، يوفر مشروع Google DeepMind التجريبي مساراً ملموساً لتقييم الذكاء الاصطناعي الموثوق. لا تلغي هذه الطريقة كل تحديات التدقيق، لكنها تزيل المصدر الأكثر وضوحاً للانحياز — وهو تلوث التقييم المرجعي — دون إجبار أي من الطرفين على التنازل عن أصوله الأكثر قيمة. إذا تبنى المجتمع هذه التقنية، فقد تؤخذ تقارير تقدم الذكاء الاصطناعي المستقبلية أخيراً على محمل الجد.
