أظهر الباحثون أن آثار الاستدلال المشفرة (encrypted reasoning traces) — وهي حزم صغيرة يرسلها المزود إلى جهاز المستخدم لتمكين المحادثة من الانتقال بين النماذج — يمكن فك تشفيرها بواسطة نموذج أضعف من الخدمة نفسها، مما يؤدي إلى تسريب مئات من بيانات الاعتماد والتفاصيل الخاصة. هذا الاكتشاف، المفصل في الورقة البحثية Stealing Reasoning Traces from Proprietary LLM APIs، يهدد ميزة الراحة التي تعتمد عليها شركات Anthropic وOpenAI وGoogle للحفاظ على سلاسة دردشات الذكاء الاصطناعي.
لماذا توجد الكتل المشفرة
عندما تتحدث مع نموذج لغوي كبير (LLM)، يقوم المزود ببناء "أثر استدلال" (reasoning trace): وهو سلسلة من الأوامر الداخلية، واستدعاءات الأدوات، وخطوات سلسلة الأفكار (chain-of-thought) التي أدت إلى الإجابة. وللسماح لك بالانتقال من نموذج أكبر إلى نموذج أرخص دون فقدان تلك السلسلة، يقوم المزودون بتشفير الأثر، وإرساله إلى جهازك، ويتوقعون منك إرساله مرة أخرى مع الطلب التالي. يهدف التشفير إلى الحفاظ على خصوصية الأثر مع تمكين الاستمرارية عبر الجلسات والنماذج المختلفة.
كيف يعمل الهجوم
أظهر الباحثون استغلالاً يتكون من ثلاث خطوات لا يتطلب اختراق النموذج القوي نفسه:
- التقاط كتلة استدلال مشفرة تم إنشاؤها بواسطة نموذج قوي أثناء محادثة عادية.
- تغذية تلك الكتلة لنموذج أضعف من نفس المزود، مع مطالبته بـ "قراءة" الكتلة.
- نظرًا لأن النموذج الأضعف يتشارك نفس مفاتيح فك التشفير، فإنه يُخرج المحتوى المفكوك تشفيره كنص صريح.
يعمل النموذج الأضعف كأوراكل لفك التشفير (decryption oracle). لم يلمس المهاجمون المكونات الداخلية للنموذج القوي؛ بل استخدموا ببساطة واجهة برمجة التطبيقات (API) الخاصة بالمزود ضد نفسه.
ما استعاده الباحثون
- 182 من بيانات الاعتماد – مفاتيح API، ورموز (tokens)، وأسرار أخرى مدمجة في الأثر.
- 367 قطعة من المعلومات الخاصة – أسماء، ورسائل بريد إلكتروني، وعناوين قدمها المستخدمون أثناء الدردشة.
- حمولات حقن الأوامر (Prompt-injection payloads) – تعليمات ضارة مخفية في الكتلة المشفرة يمكن تنفيذها لاحقًا عند إعادة تشغيل الأثر.
- تجاوزات فلاتر الأمان (Safety-filter bypasses) – كشف الأثر المفكوك تشفيره عن خطوات كانت ستُحظر لو تم فحصها كنص صريح، مما يسمح للمحتوى الخطير بالمرور.
تؤكد الورقة البحثية أن الضعف ليس خللاً في خوارزمية التشفير؛ فالتشفير نفسه صامد. ينبع الاختراق من خيار التصميم الذي يسمح لأي نموذج في مجموعة المزود بفك تشفير الكتلة من أجل تحسين تجربة المستخدم.
المقايضة في قلب المشكلة
بنى المزودون قدرة "تبديل النماذج" هذه في واجهات برمجة التطبيقات (APIs) الخاصة بهم لأن المطورين والمستخدمين النهائيين يقدرون الاستمرارية. لو كان التشفير مرتبطًا بنموذج واحد أو جلسة واحدة، لانقطعت عملية التسليم السلسة، مما يجبر المطورين على إعادة بناء إدارة الحالة (state management) بأنفسهم. تجادل الورقة بأن الأمن تم التضحية به عمدًا من أجل المرونة.
ما يجب على المطورين فعله الآن
- عامل آثار الاستدلال المشفرة كأنها نص صريح (clear-text). افترض أن أي سجل (log) أو ذاكرة تخزين مؤقت (cache) أو نظام مراقبة يخزنها يمكن أن يقرأه مهاجم.
- تجنب إرسال الآثار إلى المستودعات العامة. حتى كتلة واحدة شاردة يمكن أن تكشف عن العشرات من الأسرار.
- التخطيط لضوابط أكثر صرامة. قد يقوم المزودون بتشديد الأمن، مما قد يغير طريقة بناء الوكلاء (agents) متعددي النماذج.
- الانتقال إلى تسليم الحالة الصريح (explicit state hand-offs). بدلاً من الاعتماد على الاستدلال الخفي، صمم الوكلاء لإنتاج بيانات مهيكلة (JSON، XML، إلخ) يمكن تمريرها بأمان بين النماذج دون تشفير.
- تدقيق الأوامر (prompts) الخاصة بك. ابحث عن أي بيانات حساسة تنتهي في سلسلة الاستدلال وقم بإزالتها قبل إرسال الطلب.
ما يجب مراقبته من كبار المزودين
سيؤدي إصدار الورقة البحثية إلى دفع Anthropic وOpenAI وGoogle إلى إعادة تقييم سياسة فك التشفير المدمجة في واجهات برمجة التطبيقات الخاصة بهم.
التداعيات الأوسع
يؤكد هذا الاكتشاف معضلة أمنية كلاسيكية: غالبًا ما تفتح الراحة بابًا خلفيًا. من خلال السماح لأي نموذج بفك تشفير كتلة مملوكة للمستخدم، قدم المزودون للمهاجمين مسارًا منخفض الجهد للوصول إلى البيانات الحساسة. من المرجح أن تجعل الإصلاحات عمليات دمج الذكاء الاصطناعي أكثر صعوبة قليلاً، لكنها ستعيد أيضًا التوقعات بأن البيانات المشفرة تظل مشفرة.
الخلاصة: آثار الاستدلال المشفرة ليست حاجزًا أمنيًا؛ بل هي اختصار للراحة يمكن استخدامه ضدك. عاملها كنص صريح، وقم بتطهيرها من السجلات، وأعد تصميم الوكلاء الخاصين بك لتجاوز مستقبل لا يمكن فيه إلا للنموذج الأصلي قراءة أفكاره الخاصة.
