संशोधकांनी दाखवून दिले आहे की एन्क्रिप्टेड रिझनिंग ट्रेसेस (encrypted reasoning traces)—जे लहान पॅकेट्स प्रदाता वापरकर्त्याच्या डिव्हाइसला पाठवतो जेणेकरून संभाषण एका मॉडेलकडून दुसऱ्या मॉडेलकडे सहजपणे वळवता येईल—त्यांना त्याच सेवेतील एखादे कमकुवत मॉडेल डिक्रिप्ट करू शकते, ज्यामुळे शेकडो क्रेडेंशियल्स (credentials) आणि खाजगी तपशील उघड होऊ शकतात. Stealing Reasoning Traces from Proprietary LLM APIs या शोधनिबंधात सविस्तरपणे मांडलेला हा निष्कर्ष, Anthropic, OpenAI आणि Google कडून AI चॅट्स सुरळीत ठेवण्यासाठी वापरल्या जाणाऱ्या एका सोयीस्कर वैशिष्ट्याला धोका निर्माण करतो.
एन्क्रिप्टेड ब्लॉक्स का अस्तित्वात आहेत
जेव्हा तुम्ही लार्ज लँग्वेज मॉडेलशी (LLM) संवाद साधता, तेव्हा ती सेवा एक "रिझनिंग ट्रेस" (reasoning trace) तयार करते: म्हणजे उत्तरापर्यंत पोहोचण्यासाठी वापरलेले अंतर्गत प्रॉम्प्ट्स, टूल कॉल्स आणि चेन-ऑफ-थॉट (chain-of-thought) स्टेप्सची साखळी. ही साखळी न गमावता तुम्हाला मोठ्या मॉडेलकडून स्वस्त मॉडेलकडे स्विच करण्याची परवानगी देण्यासाठी, प्रदाते (providers) या ट्रेसला एन्क्रिप्ट करतात, तो तुमच्या डिव्हाइसवर पाठवतात आणि पुढील विनंतीसोबत तो परत पाठवावा अशी अपेक्षा करतात. हे एन्क्रिप्शन क्रॉस-सेशन आणि क्रॉस-मॉडेल सातत्य (continuity) राखताना ट्रेसची गोपनीयता राखण्यासाठी केले जाते.
हा हल्ला कसा काम करतो
संशोधकांनी तीन-टप्प्यांचा एक असा हल्ला (exploit) दाखवून दिला आहे ज्यासाठी स्वतः स्ट्रॉन्ग मॉडेलमध्ये घुसखोरी करण्याची गरज नाही:
- कॅप्चर (Capture): सामान्य संभाषणादरम्यान शक्तिशाली मॉडेलद्वारे तयार केलेला एन्क्रिप्टेड रिझनिंग ब्लॉक पकडणे.
- फीड (Feed): तो ब्लॉक त्याच प्रदात्याच्या कमकुवत मॉडेलला देणे आणि तो ब्लॉक "वाचण्यास" सांगणे.
- आउटपुट (Output): कमकुवत मॉडेलकडे तेच डिक्रिप्शन कीज (decryption keys) असल्याने, ते डिक्रिप्ट केलेली सामग्री प्लेन टेक्स्टमध्ये (plain text) आउटपुट करते.
हे कमकुवत मॉडेल एका 'डिक्रिप्शन ऑरेकल' (decryption oracle) प्रमाणे काम करते. हल्लेखोरांनी स्ट्रॉन्ग मॉडेलच्या अंतर्गत रचनेत कधीही हस्तक्षेप केला नाही; त्यांनी केवळ प्रदात्याच्या स्वतःच्या API चा वापर त्यांच्याच विरोधात केला.
संशोधकांनी काय रिकव्हर केले
- १८२ क्रेडेंशियल्स (credentials) – ट्रेसमध्ये समाविष्ट असलेले API कीज, टोकन्स आणि इतर गुपिते.
- ३६७ खाजगी माहितीचे तुकडे – वापरकर्त्यांनी चॅट दरम्यान दिलेली नावे, ईमेल, पत्ते इत्यादी.
- प्रॉम्प्ट-इंजेक्शन पेलोड्स (Prompt-injection payloads) – एन्क्रिप्टेड ब्लॉकमध्ये लपवलेले घातक सूचना, ज्या ट्रेस पुन्हा प्ले केल्यावर कार्यान्वित होऊ शकतात.
- सेफ्टी-फिल्टर बायपास (Safety-filter bypasses) – डिक्रिप्ट केलेल्या ट्रेसमध्ये अशा स्टेप्स समोर आल्या ज्या प्लेन टेक्स्टमध्ये असल्यास ब्लॉक केल्या गेल्या असत्या, ज्यामुळे धोकादायक मजकूर सहजपणे पुढे जाऊ शकतो.
शोधनिबंधात असे नमूद केले आहे की ही कमजोरी क्रिप्टोग्राफिक अल्गोरिदममधील दोष नाही; एन्क्रिप्शन स्वतः सुरक्षित आहे. ही त्रुटी वापरकर्त्याच्या अनुभवासाठी प्रदात्याच्या सर्व मॉडेल्सना तो ब्लॉक डिक्रिप्ट करण्याची परवानगी देण्याच्या डिझाइन निवडीमुळे निर्माण झाली आहे.
या समस्येच्या केंद्रस्थानी असलेला तडजोड (trade-off)
डेव्हलपर्स आणि एंड-युजर्सना सातत्य हवे असल्याने प्रदात्यांनी त्यांच्या API मध्ये ही "मॉडेल-स्विचिंग" क्षमता तयार केली आहे. जर एन्क्रिप्शन एखाद्या विशिष्ट मॉडेल इन्स्टन्स किंवा सेशनशी जोडलेले असते, तर हे स्मूथ हँड-ऑफ (smooth hand-off) खंडित झाले असते आणि डेव्हलपर्सना स्टेट मॅनेजमेंट (state management) स्वतः हाताळावे लागले असते. शोधनिबंधाचा असा युक्तिवाद आहे की लवचिकतेसाठी (flexibility) सुरक्षा जाणीवपूर्वक बाजूला सारली गेली.
डेव्हलपर्सनी आता काय करावे
- एन्क्रिप्टेड ट्रेसेसना क्लिअर-टेक्स्ट (clear-text) समजा. कोणताही लॉग, कॅशे किंवा मॉनिटरिंग सिस्टम जो ते साठवतो, तो एखादा हल्लेखोर वाचू शकतो असे गृहीत धरा.
- पब्लिक रिपॉझिटरीजमध्ये ट्रेसेस कमिट करणे टाळा. एक छोटासा ब्लॉक देखील डझनांसारखी गुपिते उघड करू शकतो.
- कठोर नियंत्रणांची (tighter controls) योजना करा. प्रदाते सुरक्षा अधिक कडक करू शकतात, ज्यामुळे मल्टी-मॉडेल एजंट्स बनवण्याची पद्धत बदलू शकते.
- स्पष्ट स्टेट हँड-ऑफ्सकडे (explicit state hand-offs) वळा. लपलेल्या रिझनिंगवर अवलंबून राहण्याऐवजी, एजंट्सना स्ट्रक्चर्ड डेटा (JSON, XML, इ.) आउटपुट करण्यासाठी डिझाइन करा, जो एन्क्रिप्शनशिवाय मॉडेल्समध्ये सुरक्षितपणे पास केला जाऊ शकतो.
- तुमचे प्रॉम्प्ट्स ऑडिट करा. रिझनिंग चेनमध्ये जाणारी कोणतीही संवेदनशील माहिती तपासा आणि विनंती पाठवण्यापूर्वी ती काढून टाका.
मोठ्या प्रदात्यांकडून काय अपेक्षा ठेवावी
या शोधनिबंधाच्या प्रकाशनामुळे Anthropic, OpenAI आणि Google यांना त्यांच्या API मध्ये समाविष्ट असलेल्या डिक्रिप्शन पॉलिसीचा पुनर्विचार करण्यास भाग पाडले जाईल.
व्यापक परिणाम
हा शोध एका क्लासिक सुरक्षा पेचप्रसंग अधोरेखित करतो: सोय (convenience) अनेकदा बॅकडोअर उघडते. वापरकर्त्याच्या मालकीचा ब्लॉक डिक्रिप्ट करण्यासाठी कोणत्याही मॉडेलला परवानगी देऊन, प्रदात्यांनी हल्लेखोरांना संवेदनशील डेटा मिळवण्यासाठी एक सोपा मार्ग उपलब्ध करून दिला आहे. याचे निराकरण केल्यामुळे AI इंटिग्रेशन थोडे कठीण होऊ शकते, परंतु एन्क्रिप्टेड डेटा एन्क्रिप्टेडच राहतो, या अपेक्षेलाही यामुळे पुन्हा महत्त्व प्राप्त होईल.
महत्त्वाचा मुद्दा (Takeaway): एन्क्रिप्टेड रिझनिंग ट्रेसेस ही कोणतीही सुरक्षा सीमा (security boundary) नाही; ती केवळ एक सोय आहे जी तुमच्या विरोधात वापरली जाऊ शकते. त्यांना प्लेन टेक्स्टप्रमाणे समजा, लॉगमधून ते काढून टाका आणि अशा भविष्यासाठी तुमच्या एजंट्सची पुनर्रचना करा जिथे केवळ मूळ मॉडेलच स्वतःचे विचार वाचू शकेल.
