शोधकर्ताओं ने दिखाया है कि एन्क्रिप्टेड रीजनिंग ट्रेसेस (encrypted reasoning traces)—छोटे पैकेट जो एक प्रदाता उपयोगकर्ता के डिवाइस को भेजता है ताकि बातचीत एक मॉडल से दूसरे मॉडल पर जा सके—उसी सेवा के एक कमजोर मॉडल द्वारा डिक्रिप्ट किए जा सकते हैं, जिससे सैकड़ों क्रेडेंशियल्स और निजी विवरण लीक हो सकते हैं। Stealing Reasoning Traces from Proprietary LLM APIs नामक शोध पत्र में विस्तृत यह खोज उस सुविधा के लिए खतरा पैदा करती है जिस पर Anthropic, OpenAI और Google AI चैट को सुचारू बनाए रखने के लिए भरोसा करते हैं।

एन्क्रिप्टेड ब्लॉक्स क्यों मौजूद हैं

जब आप किसी लार्ज लैंग्वेज मॉडल (LLM) से बात करते हैं, तो सेवा एक "रीजनिंग ट्रेस" (reasoning trace) तैयार करती है: आंतरिक प्रॉम्प्ट्स, टूल कॉल्स और चेन-ऑफ-थॉट (chain-of-thought) चरणों की एक श्रृंखला जो उत्तर तक ले जाती है। उस श्रृंखला को खोए बिना आपको एक बड़े मॉडल से सस्ते मॉडल पर स्विच करने की अनुमति देने के लिए, प्रदाता ट्रेस को एन्क्रिप्ट करते हैं, उसे आपके डिवाइस पर भेजते हैं, और उम्मीद करते हैं कि आप इसे अगली रिक्वेस्ट के साथ वापस भेजेंगे। एन्क्रिप्शन का उद्देश्य क्रॉस-सेशन और क्रॉस-मॉडल निरंतरता (continuity) को सक्षम करते हुए ट्रेस को निजी रखना है।

यह हमला कैसे काम करता है

शोधकर्ताओं ने एक तीन-चरणीय शोषण (exploit) का प्रदर्शन किया जिसमें स्वयं मजबूत मॉडल के उल्लंघन की आवश्यकता नहीं होती है:

  1. Capture (कैप्चर करें): एक सामान्य बातचीत के दौरान एक शक्तिशाली मॉडल द्वारा उत्पन्न एन्क्रिप्टेड रीजनिंग ब्लॉक को कैप्चर करें।
  2. Feed (फीड करें): उस ब्लॉक को उसी प्रदाता के एक कमजोर मॉडल को दें और उसे ब्लॉक को "पढ़ने" के लिए कहें।
  3. क्योंकि कमजोर मॉडल एक ही डिक्रिप्शन कुंजियों (decryption keys) को साझा करता है, इसलिए यह डिक्रिप्ट की गई सामग्री को प्लेन टेक्स्ट में outputs (आउटपुट) करता है।

कमजोर मॉडल एक डिक्रिप्शन ऑरेकल (decryption oracle) के रूप में कार्य करता है। हमलावरों ने कभी भी मजबूत मॉडल के आंतरिक कामकाज (internals) को नहीं छुआ; उन्होंने बस प्रदाता के अपने API का उपयोग उसके विरुद्ध किया।

शोधकर्ताओं ने क्या रिकवर किया

  • 182 क्रेडेंशियल्स – ट्रेस में एम्बेडेड API कीज़, टोकन और अन्य गुप्त जानकारी।
  • 367 निजी जानकारी के टुकड़े – नाम, ईमेल, पते जो उपयोगकर्ताओं ने चैट के दौरान दिए थे।
  • प्रॉम्प्ट-इंजेक्शन पेलोड्स – एन्क्रिप्टेड ब्लॉक में छिपे दुर्भावनापूर्ण निर्देश जिन्हें बाद में ट्रेस को फिर से चलाने (replay) पर निष्पादित किया जा सकता है।
  • सेफ्टी-फ़िल्टर बाईपास – डिक्रिप्टेड ट्रेस ने उन चरणों को उजागर किया जिन्हें प्लेन टेक्स्ट में जांचने पर ब्लॉक कर दिया गया होता, जिससे खतरनाक सामग्री का निकल जाना संभव हो गया।

शोध पत्र इस बात पर जोर देता है कि यह कमजोरी क्रिप्टोग्राफिक एल्गोरिदम में कोई खामी नहीं है; एन्क्रिप्शन स्वयं बरकरार है। यह उल्लंघन उपयोगकर्ता अनुभव के लिए प्रदाता के बेड़े (fleet) के किसी भी मॉडल को ब्लॉक डिक्रिप्ट करने देने के डिज़ाइन विकल्प से उपजा है।

समस्या के मूल में मौजूद समझौता (trade-off)

प्रदाताओं ने अपने API में यह "मॉडल-स्विचिंग" क्षमता इसलिए बनाई क्योंकि डेवलपर्स और अंतिम उपयोगकर्ता निरंतरता को महत्व देते हैं। यदि एन्क्रिप्शन किसी एकल मॉडल इंस्टेंस या सत्र (session) से जुड़ा होता, तो सुचारू हैंड-ऑफ टूट जाता, जिससे डेवलपर्स को स्वयं स्टेट मैनेजमेंट (state management) को फिर से बनाना पड़ता। शोध पत्र का तर्क है कि लचीलेपन (flexibility) के लिए सुरक्षा का जानबूझकर त्याग किया गया था।

डेवलपर्स को अब क्या करना चाहिए

  • एन्क्रिप्टेड ट्रेसेस को क्लियर-टेक्स्ट की तरह मानें। मान लें कि कोई भी लॉग, कैश या मॉनिटरिंग सिस्टम जो उन्हें स्टोर करता है, उसे हमलावर द्वारा पढ़ा जा सकता है।
  • सार्वजनिक रिपॉजिटरी में ट्रेसेस को कमिट करने से बचें। एक भी भटका हुआ ब्लॉक दर्जनों रहस्यों को उजागर कर सकता है।
  • कड़े नियंत्रणों की योजना बनाएं। प्रदाता सुरक्षा को कड़ा कर सकते हैं, जिससे मल्टी-मॉडल एजेंट बनाने का तरीका बदल सकता है।
  • स्पष्ट स्टेट हैंड-ऑफ (explicit state hand-offs) की ओर बढ़ें। छिपे हुए रीजनिंग पर भरोसा करने के बजाय, एजेंटों को स्ट्रक्चर्ड डेटा (JSON, XML, आदि) आउटपुट करने के लिए डिज़ाइन करें जिसे एन्क्रिप्शन के बिना मॉडलों के बीच सुरक्षित रूप से पास किया जा सके।
  • अपने प्रॉम्प्ट्स का ऑडिट करें। किसी भी संवेदनशील डेटा की तलाश करें जो रीजनिंग चेन में चला जाता है और रिक्वेस्ट भेजने से पहले उसे हटा दें।

बड़े प्रदाताओं से क्या उम्मीद करें

इस शोध पत्र के प्रकाशन से Anthropic, OpenAI और Google को अपने API में शामिल डिक्रिप्शन नीति का पुनर्मूल्यांकन करने के लिए मजबूर होना पड़ेगा।

व्यापक निहितार्थ

यह खोज एक क्लासिक सुरक्षा दुविधा को रेखांकित करती है: सुविधा अक्सर एक बैकडोर खोल देती है। उपयोगकर्ता के स्वामित्व वाले ब्लॉक को किसी भी मॉडल को डिक्रिप्ट करने की अनुमति देकर, प्रदाताओं ने हमलावरों को संवेदनशील डेटा तक पहुँचने का एक कम-प्रयास वाला रास्ता दे दिया है। इसका समाधान संभवतः AI इंटीग्रेशन को थोड़ा अधिक जटिल बना देगा, लेकिन यह इस अपेक्षा को भी बहाल करेगा कि एन्क्रिप्टेड डेटा एन्क्रिप्टेड ही रहे।

निष्कर्ष (Takeaway): एन्क्रिप्टेड रीजनिंग ट्रेसेस कोई सुरक्षा सीमा नहीं हैं; वे सुविधा का एक शॉर्टकट हैं जिसे आपके विरुद्ध इस्तेमाल किया जा सकता है। उन्हें प्लेन टेक्स्ट की तरह मानें, उन्हें लॉग से हटा दें, और अपने एजेंटों को ऐसे भविष्य के लिए फिर से डिज़ाइन करें जहाँ केवल मूल मॉडल ही अपने विचारों को पढ़ सके।