పరిశోధకులు ఎన్‌క్రిప్టెడ్ రీజనింగ్ ట్రేసెస్ (encrypted reasoning traces)—ఒక సర్వీస్ ప్రొవైడర్ యూజర్ డివైస్‌కు పంపే చిన్న ప్యాకెట్లు, తద్వారా సంభాషణ ఒక మోడల్ నుండి మరొక మోడల్‌కు మారగలదు—అదే సర్వీస్‌కు చెందిన బలహీనమైన మోడల్ ద్వారా డీక్రిప్ట్ చేయబడతాయని నిరూపించారు. దీనివల్ల వందలాది క్రెడెన్షియల్స్ మరియు ప్రైవేట్ వివరాలు బయటపడతాయి. Stealing Reasoning Traces from Proprietary LLM APIs అనే పేపర్‌లో వివరించబడిన ఈ పరిశోధన, Anthropic, OpenAI మరియు Google వంటి సంస్థలు AI చాట్‌లను సులభతరం చేయడానికి ఉపయోగించే ఒక ఫీచర్‌కు ముప్పు కలిగిస్తోంది.

ఎన్‌క్రిప్టెడ్ బ్లాక్స్ ఎందుకు ఉంటాయి

మీరు ఒక లార్జ్ లాంగ్వేజ్ మోడల్ (LLM)తో మాట్లాడినప్పుడు, ఆ సర్వీస్ ఒక "రీజనింగ్ ట్రేస్" (reasoning trace)ను రూపొందిస్తుంది: అంటే సమాధానానికి దారితీసిన అంతర్గత ప్రాంప్ట్‌లు, టూల్ కాల్స్ మరియు చైన్-ఆఫ్-థాట్ (chain-of-thought) దశల క్రమం. ఆ క్రమాన్ని కోల్పోకుండా, మీరు ఒక పెద్ద మోడల్ నుండి తక్కువ ఖర్చుతో కూడిన మోడల్‌కు మారడానికి వీలుగా, ప్రొవైడర్లు ఆ ట్రేస్‌ను ఎన్‌క్రిప్ట్ చేసి, మీ డివైస్‌కు పంపిస్తారు మరియు తదుపరి రిక్వెస్ట్‌తో దానిని తిరిగి పంపాలని ఆశిస్తారు. ఈ ఎన్‌క్రిప్షన్ యొక్క ఉద్దేశ్యం, సెషన్ల మధ్య మరియు మోడళ్ల మధ్య కొనసాగింపును (continuity) అనుమతిస్తూనే, ఆ ట్రేస్‌ను ప్రైవేట్‌గా ఉంచడం.

ఈ దాడి ఎలా పనిచేస్తుంది

పరిశోధకులు మూడు దశల ఎక్స్‌ప్లాయిట్‌ను ప్రదర్శించారు, దీనికి బలమైన మోడల్‌ను హ్యాక్ చేయాల్సిన అవసరం లేదు:

  1. Capture చేయండి: సాధారణ సంభాషణ సమయంలో శక్తివంతమైన మోడల్ రూపొందించిన ఎన్‌క్రిప్టెడ్ రీజనింగ్ బ్లాక్‌ను పట్టుకోండి.
  2. Feed చేయండి: ఆ బ్లాక్‌ను అదే ప్రొవైడర్‌కు చెందిన బలహీనమైన మోడల్‌కు ఇచ్చి, ఆ బ్లాక్‌ను "చదవమని" అడగండి.
  3. బలహీనమైన మోడల్ అదే డీక్రిప్షన్ కీలను కలిగి ఉండటం వల్ల, అది ఆ కంటెంట్‌ను ప్లెయిన్ టెక్స్ట్‌గా outputs చేస్తుంది.

బలహీనమైన మోడల్ ఒక డీక్రిప్షన్ ఒరాకిల్ (decryption oracle)లా పనిచేస్తుంది. దాడి చేసేవారు బలమైన మోడల్ అంతర్గత వ్యవస్థలను తాకలేదు; వారు కేవలం ప్రొవైడర్ యొక్క స్వంత APIని వారికే వ్యతిరేకంగా ఉపయోగించారు.

పరిశోధకులు ఏమి తిరిగి పొందారు

  • 182 క్రెడెన్షియల్స్ – ట్రేస్‌లో ఉన్న API కీలు, టోకెన్లు మరియు ఇతర రహస్యాలు.
  • 367 ప్రైవేట్ సమాచార ముక్కలు – చాట్ సమయంలో యూజర్లు అందించిన పేర్లు, ఈమెయిల్స్, అడ్రస్‌లు.
  • Prompt-injection payloads – ఎన్‌క్రిప్టెడ్ బ్లాక్‌లో దాగి ఉన్న హానికరమైన సూచనలు, ఇవి ట్రేస్ మళ్ళీ ప్లే అయినప్పుడు అమలు చేయబడవచ్చు.
  • Safety-filter bypasses – డీక్రిప్ట్ చేయబడిన ట్రేస్ ద్వారా, ప్లెయిన్ టెక్స్ట్‌లో ఉంటే బ్లాక్ చేయబడే దశలు బయటపడ్డాయి, దీనివల్ల ప్రమాదకరమైన కంటెంట్ సులభంగా లోపలికి ప్రవేశించగలిగింది.

ఈ సమస్య క్రిప్టోగ్రాఫిక్ అల్గారిథమ్‌లో లోపం వల్ల కాదని, యూజర్ అనుభవం కోసం ప్రొవైడర్ యొక్క అన్ని మోడళ్లకు ఆ బ్లాక్‌ను డీక్రిప్ట్ చేసే అధికారం ఇవ్వడం వల్ల ఏర్పడిన డిజైన్ లోపం అని ఈ పేపర్ నొక్కి చెబుతోంది.

సమస్య యొక్క మూలంలో ఉన్న ట్రేడ్-ఆఫ్ (trade-off)

డెవలపర్లు మరియు ఎండ్-యూజర్లు కొనసాగింపును (continuity) ఇష్టపడతారు కాబట్టి, ప్రొవైడర్లు తమ APIలలో ఈ "మోడల్-స్విచ్చింగ్" సామర్థ్యాన్ని రూపొందించారు. ఒకవేళ ఎన్‌క్రిప్షన్ అనేది ఒకే మోడల్ ఇన్‌స్టాన్స్ లేదా సెషన్‌కు పరిమితమైతే, ఈ సులభమైన మార్పిడి సాధ్యపడదు, తద్వారా డెవలపర్లు స్వయంగా స్టేట్ మేనేజ్‌మెంట్‌ను (state management) నిర్మించాల్సి ఉంటుంది. సౌలభ్యం కోసం భద్రతను కావాలనే త్యాగం చేశారని ఈ పేపర్ వాదిస్తోంది.

డెవలపర్లు ఇప్పుడు ఏమి చేయాలి

  • ఎన్‌క్రిప్టెడ్ ట్రేస్‌లను క్లియర్-టెక్స్ట్‌గా పరిగణించండి. వాటిని నిల్వ చేసే ఏ లాగ్, క్యాచీ లేదా మానిటరింగ్ సిస్టమ్‌నైనా దాడి చేసేవారు చదవగలరని భావించండి.
  • ట్రేస్‌లను పబ్లిక్ రిపోజిటరీలలో ఉంచవద్దు. ఒక చిన్న బ్లాక్ కూడా డజన్ల కొద్దీ రహస్యాలను బయటపెట్టవచ్చు.
  • కఠినమైన నియంత్రణల కోసం సిద్ధంగా ఉండండి. ప్రొవైడర్లు భద్రతను పెంచవచ్చు, ఇది మల్టీ-మోడల్ ఏజెంట్ల నిర్మాణ విధానాన్ని మార్చవచ్చు.
  • Explicit state hand-offs వైపు మారండి. దాగి ఉన్న రీజనింగ్‌పై ఆధారపడటానికి బదులుగా, ఎన్‌క్రిప్షన్ లేకుండా మోడళ్ల మధ్య సురక్షితంగా పంపగలిగే స్ట్రక్చర్డ్ డేటా (JSON, XML, మొదలైనవి)ను అవుట్‌పుట్ చేసేలా ఏజెంట్లను రూపొందించండి.
  • మీ ప్రాంప్ట్‌లను ఆడిట్ చేయండి. రీజనింగ్ చైన్‌లోకి వెళ్లే ఏవైనా సున్నితమైన డేటాను గుర్తించి, రిక్వెస్ట్ పంపే ముందే వాటిని తొలగించండి.

పెద్ద ప్రొవైడర్ల నుండి ఏమి గమనించాలి

ఈ పేపర్ విడుదల కావడం వల్ల Anthropic, OpenAI మరియు Google తమ APIలలో ఉన్న డీక్రిప్షన్ పాలసీలను పునఃసమీక్షించాల్సి ఉంటుంది.

విస్తృత ప్రభావం

ఈ ఆవిష్కరణ ఒక క్లాసిక్ సెక్యూరిటీ డిలెమ్మను (security dilemma) నొక్కి చెబుతుంది: సౌలభ్యం తరచుగా ఒక బ్యాక్‌డోర్ (backdoor)ను తెరుస్తుంది. యూజర్ యాజమాన్యంలోని బ్లాక్‌ను ఏ మోడల్ అయినా డీక్రిప్ట్ చేయడానికి అనుమతించడం ద్వారా, ప్రొవైడర్లు దాడి చేసేవారికి సున్నితమైన డేటా కోసం ఒక సులభమైన మార్గాన్ని అందించారు. దీనికి పరిష్కారం కనుగొంటే AI ఇంటిగ్రేషన్లు కొంచెం కష్టతరం కావచ్చు, కానీ ఎన్‌క్రిప్టెడ్ డేటా ఎన్‌క్రిప్టెడ్ గానే ఉండాలనే నమ్మకాన్ని ఇది పునరుద్ధరిస్తుంది.

Takeaway: ఎన్‌క్రిప్టెడ్ రీజనింగ్ ట్రేసెస్ భద్రతా సరిహద్దులు (security boundary) కావు; అవి మీకు వ్యతిరేకంగా ఉపయోగించబడగల సౌలభ్యపు షార్ట్‌కట్‌లు మాత్రమే. వాటిని ప్లెయిన్ టెక్స్ట్‌గా పరిగణించండి, లాగ్‌ల నుండి వాటిని తొలగించండి మరియు కేవలం ఆ మూల మోడల్ మాత్రమే తన ఆలోచనలను చదవగలిగే భవిష్యత్తు కోసం మీ ఏజెంట్లను పునర్నిర్మించండి.