સંશોધકોએ દર્શાવ્યું છે કે એન્ક્રિપ્ટેડ રીઝનિંગ ટ્રેસિસ (encrypted reasoning traces)—નાની પેકેટ્સ જે પ્રોવાઈડર યુઝરના ઉપકરણ પર મોકલે છે જેથી વાતચીત એક મોડેલમાંથી બીજા મોડેલમાં સ્વિચ થઈ શકે—તેમને તે જ સર્વિસના નબળા મોડેલ દ્વારા ડિક્રિપ્ટ કરી શકાય છે, જેનાથી સેંકડો ક્રેડેન્શિયલ્સ અને ખાનગી વિગતો લીક થઈ શકે છે. Stealing Reasoning Traces from Proprietary LLM APIs પેપરમાં વિગતવાર જણાવવામાં આવેલ આ શોધ, Anthropic, OpenAI અને Google જે સુગમ AI ચેટ માટે નિર્ભર છે તે સુવિધા માટે જોખમ ઊભું કરે છે.
એન્ક્રિપ્ટેડ બ્લોક્સ શા માટે અસ્તિત્વ ધરાવે છે
જ્યારે તમે લાર્જ લેંગ્વેજ મોડેલ (LLM) સાથે વાત કરો છો, ત્યારે સર્વિસ એક “reasoning trace” બનાવે છે: આંતરિક પ્રોમ્પ્ટ્સ, ટૂલ કોલ્સ અને chain-of-thought સ્ટેપ્સની સાંકળ જે જવાબ સુધી લઈ જાય છે. આ સાંકળ ગુમાવ્યા વિના તમને મોટા મોડેલમાંથી સસ્તા મોડેલ પર સ્વિચ કરવા દેવા માટે, પ્રોવાઈડર્સ ટ્રેસને એન્ક્રિપ્ટ કરે છે, તેને તમારા ઉપકરણ પર મોકલે છે, અને એવી અપેક્ષા રાખે છે કે તમે તેને આગામી વિનંતી સાથે પાછું મોકલો. એન્ક્રિપ્શનનો હેતુ ટ્રેસને ખાનગી રાખવાનો છે અને સાથે સાથે cross-session, cross-model સાતત્ય (continuity) સક્ષમ કરવાનો છે.
આ હુમલો કેવી રીતે કામ કરે છે
સંશોધકોએ ત્રણ-પગલાંની એક્સપ્લોઈટ (exploit) દર્શાવી છે જેમાં મજબૂત મોડેલના પોતાના બ્રેચની જરૂર નથી:
- Capture (કેપ્ચર): સામાન્ય વાતચીત દરમિયાન શક્તિશાળી મોડેલ દ્વારા જનરેટ કરવામાં આવેલ એન્ક્રિપ્ટેડ રીઝનિંગ બ્લોક મેળવો.
- Feed (ફીડ): તે બ્લોક તે જ પ્રોવાઈડરના નબળા મોડેલને આપો અને તેને બ્લોક “વાંચવા” માટે કહો.
- કારણ કે નબળું મોડેલ સમાન ડિક્રિપ્શન કી શેર કરે છે, તે ડિક્રિપ્ટેડ સામગ્રીને પ્લેન ટેક્સ્ટમાં outputs (આઉટપુટ) કરે છે.
નબળું મોડેલ એક decryption oracle તરીકે કામ કરે છે. હુમલાખોરોએ ક્યારેય મજબૂત મોડેલના ઇન્ટરનલ્સને સ્પર્શ કર્યો નથી; તેઓએ ફક્ત પ્રોવાઈડરના પોતાના API નો ઉપયોગ તેની વિરુદ્ધમાં કર્યો છે.
સંશોધકોએ શું રિકવર કર્યું
- 182 ક્રેડેન્શિયલ્સ – ટ્રેસમાં સમાવિષ્ટ API કી, ટોકન્સ અને અન્ય સિક્રેટ્સ.
- 367 ખાનગી માહિતીના ટુકડા – નામો, ઈમેલ, એડ્રેસ જે યુઝર્સે ચેટ દરમિયાન આપ્યા હતા.
- Prompt-injection payloads – એન્ક્રિપ્ટેડ બ્લોકમાં છુપાયેલ દૂષિત સૂચનાઓ જે ટ્રેસ ફરીથી ચલાવવામાં આવે ત્યારે પછીથી અમલમાં મૂકી શકાય છે.
- Safety-filter bypasses – ડિક્રિપ્ટ કરેલ ટ્રેસે એવા સ્ટેપ્સ જાહેર કર્યા જે જો પ્લેન ટેક્સ્ટમાં તપાસવામાં આવ્યા હોત તો બ્લોક થઈ ગયા હોત, જેનાથી જોખમી સામગ્રી પસાર થઈ શકે છે.
પેપર ભાર મૂકે છે કે આ નબળાઈ ક્રિપ્ટોગ્રાફિક અલ્ગોરિધમમાં કોઈ ખામી નથી; એન્ક્રિપ્શન પોતે મજબૂત છે. આ બ્રેચ યુઝર એક્સપિરિયન્સ માટે પ્રોવાઈડરના ફ્લીટમાંના કોઈપણ મોડેલને બ્લોક ડિક્રિપ્ટ કરવા દેવાના ડિઝાઇન ચોઈસમાંથી ઉદભવે છે.
આ સમસ્યાના મૂળમાં રહેલો ટ્રેડ-ઓફ (trade-off)
પ્રોવાઈડર્સે તેમની API માં આ “model-switching” ક્ષમતા બનાવી છે કારણ કે ડેવલપર્સ અને અંતિમ વપરાશકર્તાઓ સાતત્યને મહત્વ આપે છે. જો એન્ક્રિપ્શન કોઈ સિંગલ મોડેલ ઇન્સ્ટન્સ અથવા સેશનમાં બંધાયેલું હોત, તો સ્મૂધ હેન્ડ-ઓફ તૂટી જાત, જેનાથી ડેવલપર્સને સ્ટેટ મેનેજમેન્ટ જાતે જ ફરીથી બનાવવું પડત. પેપર દલીલ કરે છે કે લવચીકતા (flexibility) માટે સુરક્ષાનો જાણીજોઈને ત્યાગ કરવામાં આવ્યો હતો.
ડેવલપર્સે હવે શું કરવું જોઈએ
- એન્ક્રિપ્ટેડ ટ્રેસને ક્લિયર-ટેક્સ્ટ તરીકે ગણો. ધારો કે કોઈપણ લોગ, કેશ અથવા મોનિટરિંગ સિસ્ટમ જે તેને સ્ટોર કરે છે તેને હુમલાખોર દ્વારા વાંચી શકાય છે.
- પબ્લિક રિપોઝીટરીઝમાં ટ્રેસ કમિટ કરવાનું ટાળો. એક જ ભૂલથી નીકળેલો બ્લોક ડઝનબંધ સિક્રેટ્સને ખુલ્લા કરી શકે છે.
- કડક નિયંત્રણો માટે આયોજન કરો. પ્રોવાઈડર્સ સુરક્ષા વધારી શકે છે, જે મલ્ટી-મોડેલ એજન્ટ્સ બનાવવાની રીત બદલી શકે છે.
- એક્સપ્લિસિટ સ્ટેટ હેન્ડ-ઓફ્સ તરફ વળો. છુપાયેલા રીઝનિંગ પર આધાર રાખવાને બદલે, એજન્ટ્સને સ્ટ્રક્ચર્ડ ડેટા (JSON, XML, વગેરે) આઉટપુટ કરવા માટે ડિઝાઇન કરો જે એન્ક્રિપ્શન વગર મોડેલ્સ વચ્ચે સુરક્ષિત રીતે પસાર કરી શકાય છે.
- તમારા પ્રોમ્પ્ટ્સનું ઓડિટ કરો. રીઝનિંગ ચેઈનમાં સમાવિષ્ટ કોઈપણ સંવેદનશીલ ડેટા શોધો અને વિનંતી મોકલતા પહેલા તેને દૂર કરો.
મોટા પ્રોવાઈડર્સ પાસેથી શું અપેક્ષા રાખવી
આ પેપરના રિલીઝથી Anthropic, OpenAI અને Google તેમની API માં સમાવિષ્ટ ડિક્રિપ્શન પોલિસીનું પુનઃમૂલ્યાંકન કરવા માટે પ્રેરાશે.
વ્યાપક અસરો
આ શોધ એક ક્લાસિક સુરક્ષા દ્વિધાને રેખાંકિત કરે છે: સુવિધા ઘણીવાર બેકડોર ખોલી દે છે. કોઈપણ મોડેલને યુઝરના બ્લોકને ડિક્રિપ્ટ કરવાની મંજૂરી આપીને, પ્રોવાઈડર્સે હુમલાખોરોને સંવેદનશીલ ડેટા માટે ઓછી મહેનત વાળો માર્ગ આપી દીધો છે. આ સુધારો કદાચ AI ઇન્ટિગ્રેશનને થોડું જટિલ બનાવશે, પરંતુ તે એ અપેક્ષા પણ પુનઃસ્થાપિત કરશે કે એન્ક્રિપ્ટેડ ડેટા એન્ક્રિપ્ટેડ જ રહે છે.
મુખ્ય વાત (Takeaway): એન્ક્રિપ્ટેડ રીઝનિંગ ટ્રેસિસ એ સુરક્ષા સીમા નથી; તે એક સુવિધાજનક શોર્ટકટ છે જે તમારી વિરુદ્ધ વાપરી શકાય છે. તેમને પ્લેન ટેક્સ્ટ તરીકે ગણો, લોગ્સમાંથી તેમને દૂર કરો, અને તમારા એજન્ટ્સને એવા ભવિષ્ય માટે ફરીથી ડિઝાઇન કરો જ્યાં માત્ર મૂળ મોડેલ જ પોતાના વિચારો વાંચી શકે.
