ஆராய்ச்சியாளர்கள் காட்டியுள்ளதாவது, குறியாக்கம் செய்யப்பட்ட reasoning traces—ஒரு சேவை வழங்குநர் பயனரின் சாதனத்திற்கு அனுப்பும் சிறிய தரவுப் பொட்டலங்கள்—அதே சேவையின் ஒரு பலவீனமான மாடலால் (weaker model) குறியாக்க நீக்கம் செய்யப்பட முடியும். இது நூற்றுக்கணக்கான கடவுச்சொற்கள் மற்றும் தனிப்பட்ட விவரங்களை வெளிப்படுத்துகிறது. Stealing Reasoning Traces from Proprietary LLM APIs என்ற ஆய்வறிக்கையில் விவரிக்கப்பட்டுள்ள இந்த கண்டுபிடிப்பு, Anthropic, OpenAI மற்றும் Google ஆகிய நிறுவனங்கள் AI உரையாடல்களைத் தடையின்றி நடத்தப் பயன்படுத்தும் ஒரு வசதியை அச்சுறுத்துகிறது.

ஏன் இந்த குறியாக்கம் செய்யப்பட்ட பிளாக்குகள் உள்ளன

நீங்கள் ஒரு பெரிய மொழி மாதிரியுடன் (LLM) பேசும்போது, அந்தச் சேவை ஒரு “reasoning trace”-ஐ உருவாக்குகிறது: அதாவது பதிலுக்கு வழிவகுத்த உள் தூண்டுதல்கள் (internal prompts), கருவி அழைப்புகள் (tool calls) மற்றும் சிந்தனைச் சங்கிலி (chain-of-thought) படிநிலைகள் ஆகியவற்றின் தொடர். அந்தச் சங்கிலியை இழக்காமல், ஒரு பெரிய மாடலில் இருந்து மலிவான மாடலுக்கு மாற அனுமதிப்பதற்காக, வழங்குநர்கள் அந்தத் தடயத்தை குறியாக்கம் செய்து, உங்கள் சாதனத்திற்கு அனுப்புகிறார்கள், பின்னர் அடுத்த கோரிக்கையுடன் அதைத் திருப்பி அனுப்புவீர்கள் என்று எதிர்பார்க்கிறார்கள். இந்த குறியாக்கம், வெவ்வேறு அமர்வுகள் மற்றும் மாடல்களுக்கு இடையிலான தொடர்ச்சியை (continuity) வழங்கும் அதே வேளையில், அந்தத் தடயத்தை ரகசியமாக வைத்திருக்க வடிவமைக்கப்பட்டுள்ளது.

இந்தத் தாக்குதல் எவ்வாறு செயல்படுகிறது

ஆராய்ச்சியாளர்கள் மூன்று படிநிலைகளைக் கொண்ட ஒரு முறையை நிரூபித்தனர், இதற்கு வலுவான மாடலைத் துளைக்க வேண்டிய அவசியமில்லை:

  1. Capture: சாதாரண உரையாடலின் போது ஒரு சக்திவாய்ந்த மாடலால் உருவாக்கப்பட்ட குறியாக்கம் செய்யப்பட்ட reasoning block-ஐப் பெறுதல்.
  2. Feed: அந்தப் பிளாக்கை அதே வழங்குநரின் ஒரு பலவீனமான மாடலுக்குக் கொடுத்து, அதை “வாசிக்கச்” சொல்லுதல்.
  3. அந்தப் பலவீனமான மாடல் அதே குறியாக்க சாவிகளைப் (decryption keys) பகிர்ந்து கொள்வதால், அது குறியாக்க நீக்கம் செய்யப்பட்ட உள்ளடக்கத்தை சாதாரண உரையாக (plain text) வெளியிடுகிறது (outputs).

பலவீனமான மாடல் ஒரு decryption oracle போலச் செயல்படுகிறது. தாக்குபவர்கள் வலுவான மாடலின் உட்பகுதியைத் தொடவே இல்லை; அவர்கள் வழங்குநரின் சொந்த API-யையே அவருக்கு எதிராகப் பயன்படுத்தினர்.

ஆராய்ச்சியாளர்கள் மீட்டெடுத்தவை

  • 182 credentials – தடயத்தில் இணைக்கப்பட்ட API keys, tokens மற்றும் பிற ரகசியங்கள்.
  • 367 தனிப்பட்ட தகவல்கள் – உரையாடலின் போது பயனர்கள் வழங்கிய பெயர்கள், மின்னஞ்சல்கள், முகவரிகள்.
  • Prompt-injection payloads – குறியாக்கம் செய்யப்பட்ட பிளாக்கில் மறைந்துள்ள தீய கட்டளைகள், இவை தடயம் மீண்டும் இயக்கப்படும்போது செயல்படுத்தப்படலாம்.
  • Safety-filter bypasses – சாதாரண உரையாகப் பார்த்தால் தடுக்கப்பட்டிருக்க வேண்டிய படிநிலைகளை, குறியாக்க நீக்கம் செய்யப்பட்ட தடயம் வெளிப்படுத்தியது, இது ஆபத்தான உள்ளடக்கங்கள் தடையின்றிச் செல்ல வழிவகுத்தது.

இந்தக் கண்டுபிடிப்பு, பலவீனம் என்பது குறியாக்க அல்காரிதத்தில் (cryptographic algorithm) உள்ள குறைபாடு அல்ல; குறியாக்கமே சரியாக உள்ளது என்பதை வலியுறுத்துகிறது. பயனர் அனுபவத்திற்காக, வழங்குநரின் எந்தவொரு மாடலும் அந்த பிளாக்கை குறியாக்க நீக்கம் செய்ய அனுமதிக்க வேண்டும் என்ற வடிவமைப்பால் இந்தத் துளை உருவாகியுள்ளது.

இந்த சிக்கலின் மையத்திலுள்ள சமரசம் (Trade-off)

டெவலப்பர்கள் மற்றும் இறுதிப் பயனர்கள் தொடர்ச்சியை (continuity) விரும்புவதால், வழங்குநர்கள் தங்கள் API-களில் இந்த “model-switching” வசதியை உருவாக்கினர். குறியாக்கம் ஒரு குறிப்பிட்ட மாடல் அல்லது அமர்வோடு (session) மட்டும் இணைக்கப்பட்டிருந்தால், அந்தத் தடையற்ற மாற்றம் தடைபடும், இதனால் டெவலப்பர்கள் தாங்களாகவே state management-ஐ உருவாக்க வேண்டியிருக்கும். நெகிழ்வுத்தன்மைக்காகப் பாதுகாப்பு வேண்டுமென்றே தியாகம் செய்யப்பட்டது என்று ஆய்வறிக்கை வாதிடுகிறது.

டெவலப்பர்கள் இப்போது என்ன செய்ய வேண்டும்

  • குறியாக்கம் செய்யப்பட்ட தடயங்களை சாதாரண உரையாகவே (clear-text) கருதுங்கள். அவற்றைச் சேமிக்கும் எந்தவொரு லாக் (log), கேச் (cache) அல்லது கண்காணிப்பு அமைப்பையும் ஒரு தாக்குபவர் படிக்க முடியும் என்று கருதுங்கள்.
  • தடயங்களை பொதுவான களஞ்சியங்களில் (public repositories) பதிவேற்றுவதைத் தவிர்க்கவும். ஒரு சிறிய பிளாக் கூட டஜன் கணக்கான ரகசியங்களை வெளிப்படுத்தலாம்.
  • கடுமையான கட்டுப்பாடுகளுக்குத் திட்டமிடுங்கள். வழங்குநர்கள் பாதுகாப்பை அதிகரிக்கலாம், இது பல-மாடல் ஏஜெண்டுகளை (multi-model agents) உருவாக்கும் முறையை மாற்றக்கூடும்.
  • வெளிப்படையான state hand-offs முறைக்கு மாறுங்கள். மறைக்கப்பட்ட reasoning-ஐச் சார்ந்திருப்பதற்குப் பதிலாக, குறியாக்கம் செய்யாமல் மாடல்களுக்கு இடையே பாதுகாப்பாகப் பகிரக்கூடிய கட்டமைக்கப்பட்ட தரவுகளை (JSON, XML, போன்றவை) வெளியிடும் வகையில் ஏஜெண்டுகளை வடிவமைக்கவும்.
  • உங்கள் ப்ராம்ப்ட்களை (prompts) ஆய்வு செய்யுங்கள். reasoning சங்கிலியில் நுழையும் எந்தவொரு முக்கியமான தரவையும் கண்டறிந்து, கோரிக்கையை அனுப்பும் முன்பே அதை நீக்கிவிடுங்கள்.

பெரிய நிறுவனங்களிடமிருந்து எதைக் கவனிக்க வேண்டும்

இந்த ஆய்வறிக்கையின் வெளியீடு, Anthropic, OpenAI மற்றும் Google ஆகிய நிறுவனங்களைத் தங்கள் API-களில் உள்ள குறியாக்க நீக்கக் கொள்கையை (decryption policy) மறுஆய்வு செய்யத் தூண்டும்.

பரந்த தாக்கம்

இந்தக் கண்டுபிடிப்பு ஒரு பாரம்பரிய பாதுகாப்புச் சிக்கலை அடிக்கோடிட்டுக் காட்டுகிறது: வசதி (convenience) பெரும்பாலும் ஒரு ரகசிய நுழைவாயிலைத் (backdoor) திறக்கிறது. பயனருக்குச் சொந்தமான ஒரு பிளாக்கை எந்த மாடலும் குறியாக்க நீக்கம் செய்ய அனுமதிப்பதன் மூலம், வழங்குநர்கள் தாக்குபவர்களுக்குத் முக்கியமான தரவுகளைப் பெற ஒரு எளிதான வழியைத் தந்துவிட்டனர். இதற்கான தீர்வு AI ஒருங்கிணைப்புகளைச் சற்றே கடினமாக்கலாம், ஆனால் குறியாக்கம் செய்யப்பட்ட தரவு குறியாக்கம் செய்யப்பட்ட நிலையிலேயே இருக்கும் என்ற நம்பிக்கையை இது மீண்டும் நிலைநாட்டும்.

சுருக்கம்: குறியாக்கம் செய்யப்பட்ட reasoning traces ஒரு பாதுகாப்பு எல்லையல்ல; அவை உங்களுக்கு எதிராகத் திருப்பப்படக்கூடிய ஒரு வசதிக்கான குறுக்குவழி மட்டுமே. அவற்றை சாதாரண உரையாகக் கருதுங்கள், லாக்ஸ்களில் இருந்து அவற்றை நீக்குங்கள், மேலும் ஒரு மாடல் தனது சொந்தச் சிந்தனைகளை மட்டுமே படிக்க முடியும் என்ற எதிர்காலத்திற்கு ஏற்ப உங்கள் ஏஜெண்டுகளை மறுவடிவமைப்பு செய்யுங்கள்.