OpenAI ఈరోజు GPT-Redను విడుదల చేసింది, ఇది ఒక ఆటోమేటెడ్ రెడ్-టీమ్ హ్యాకర్ వలె పనిచేసే లార్జ్-లాంగ్వేజ్ మోడల్. ఈ సిస్టమ్ ఇప్పటికే కంపెనీ యొక్క తాజా GPT-5.6 మోడల్ను మరింత సురక్షితం చేస్తోంది, దీనివల్ల అనుకరించబడిన (simulated) దాడుల విజయ రేటు 90% కంటే ఎక్కువగా ఉన్న స్థాయి నుండి 23% కంటే తక్కువకు పడిపోయింది.
GPT-Red రెడ్-టీమ్ పనిని ఎలా ఆటోమేట్ చేస్తుంది
రెడ్-టీమ్ టెస్టింగ్—అంటే ఒక సిస్టమ్ను కావాలనే పాడుచేయడానికి లేదా హైజాక్ చేయడానికి ప్రయత్నించడం—సాధారణంగా సెక్యూరిటీ నిపుణులపై ఆధారపడి ఉండేది. LLMలు వెబ్ను బ్రౌజ్ చేయడం, కోడ్ను రన్ చేయడం మరియు థర్డ్-పార్టీ సర్వీసులను పిలవడం నేర్చుకుంటున్న కొద్దీ, వాటిని దుర్వినియోగం చేసే మార్గాలు మానవ బృందం అన్వేషించగలిగే దానికంటే వేగంగా పెరుగుతున్నాయి.
పరిశోధకులు 'డోజో' (dojo) అని పిలిచే ఒక సిమ్యులేటెడ్ ఎన్విరాన్మెంట్లో, ఒక మోడల్ యొక్క కాపీని మరొక దానితో పోరాడేలా చేసే "సెల్ఫ్-ప్లే లూప్" (self-play loop) ద్వారా OpenAI దీనికి సమాధానం ఇచ్చింది. ఈ సాండ్బాక్స్లో, GPT-Red దాడి చేసే పాత్రను పోషిస్తుండగా, ఒకటి లేదా అంతకంటే ఎక్కువ డిఫెండర్ మోడల్స్ దాన్ని నిరోధించడానికి ప్రయత్నిస్తాయి. ఈ రెండు పక్షాలు లెక్కలేనన్ని రౌండ్లు నిర్వహిస్తాయి; ప్రతి ఇటరేషన్ దాడి చేసే వ్యక్తిని మరింత సూక్ష్మమైన లోపాలను కనుగొనేలా మరియు డిఫెండర్ను కొత్త రక్షణ పద్ధతులను నేర్చుకునేలా ప్రేరేపిస్తుంది. OpenAI ఈ ప్రక్రియను GPT-5.6ను రూపొందించిన ట్రైనింగ్ పైప్లైన్లోనే చేర్చింది, దీనిని కంపెనీ ఇప్పటివరకు విడుదల చేసిన అత్యంత శక్తివంతమైన (robust) వెర్షన్గా పేర్కొంటోంది.
కొత్త రకమైన దాడి: ఫేక్ చైన్ ఆఫ్ థాట్ (fake chain of thought)
ఈ సెల్ఫ్-ప్లే రన్ల ద్వారా ఒక ఆశ్చర్యకరమైన "ఫేక్ చైన్ ఆఫ్ థాట్" దాడి వెలుగులోకి వచ్చింది. LLMలు తరచుగా తుది సమాధానానికి మార్గదర్శకంగా ఉండే దశలవారీ తర్కాన్ని—ఒక "చైన్ ఆఫ్ థాట్"—అందిస్తాయి. ఆ తర్కంలో తప్పుడు సమాచారాన్ని (spurious entries) చేర్చడం ద్వారా, తప్పుగా ఉన్న అంశాలను కూడా ఇప్పటికే సరిచూసుకున్నట్లుగా మోడల్ను నమ్మించేలా GPT-Red నేర్చుకుంది. ఉదాహరణకు, "1 + 1 = 3" అని సరిచూసుకున్నట్లుగా దాడి చేసే వ్యక్తి మోడల్ను ఒప్పించగలడు, తద్వారా సిస్టమ్ ఆ తప్పుడు ఫలితం ఆధారంగా సమాధానాలను ఇస్తుంది.
ఈ దాడి కేవలం టెక్స్ట్ జనరేటర్లకు మాత్రమే పరిమితం కాదు. ఒక బాహ్య ల్యాబ్ రూపొందించిన "Vendy" అనే వెండింగ్-మెషిన్ తరహా ఏజెంట్పై చేసిన పరీక్షలో, GPT-Red ధరల వివరాలను మార్చడం మరియు ఆర్డర్లను రద్దు చేయడం వంటివి చేసింది. దీనివల్ల వినియోగదారుల ఆదేశాల మేరకు పనిచేసే ప్రత్యేక ఏజెంట్లపై కూడా ఈ సాంకేతికత పనిచేస్తుందని నిరూపితమైంది.
కొలవదగిన భద్రతా మెరుగుదల
GPT-Red ద్వారా జరిగిన శిక్షణ యొక్క ప్రభావాన్ని చూపే గణాంకాలను OpenAI విడుదల చేసింది. కొత్త మోడల్ రూపొందించిన అత్యంత శక్తివంతమైన దాడులను ఆగస్టులో విడుదల చేసిన GPT-5 పై ప్రయోగించినప్పుడు, 90% కంటే ఎక్కువ దాడులు విజయవంతమయ్యాయి. అదే దాడులను GPT-5.6 పై చేసినప్పుడు, అవి 23% కంటే తక్కువ సార్లు మాత్రమే విజయవంతమయ్యాయి.
2025లో జరిగిన ఒక ప్రయోగంలో GPT-Redను మానవ రెడ్-టీమర్లతో పోల్చినప్పుడు, AI మానవుల కంటే మరింత సమర్థవంతంగా దాడి చేసే పద్ధతులను కనుగొని మెరుగుపరిచింది. దీనివల్ల ఒక అడ్వర్సరియల్ మోడల్ (adversarial model) తక్కువ సమయంలోనే లోపాలు ఉన్న విస్తృతమైన ప్రాంతాలను అన్వేషించగలదని అర్థమవుతోంది.
పరిమితులు మరియు మానవ నైపుణ్యం యొక్క నిరంతర అవసరం
GPT-Red మానవ సెక్యూరిటీ అనలిస్టుల స్థానాన్ని భర్తీ చేయదు. అనేక సంభాషణల ద్వారా ఒక కథనాన్ని నిర్మించే మల్టీ-టర్న్ కన్వర్సేషనల్ దాడుల విషయంలో మరియు చిత్రాల లోపల హానికరమైన వచనాన్ని దాచే విజువల్ ప్రాంప్ట్ ఇంజెక్షన్ల విషయంలో ఇది ఇంకా ఇబ్బందులు ఎదుర్కొంటోంది. మానవ నిపుణులు పరిశోధించి మరింత విస్తరించడానికి వీలుగా, ప్రాథమిక స్థాయి పరిశీలన (first-line probe) కోసం ఈ మోడల్ను ఉపయోగించాలని OpenAI యోచిస్తోంది.
ఈ సాధనం ప్రొప్రైటరీ (proprietary) కాబట్టి, బాహ్య పరిశోధకులు దీని సామర్థ్యాలను నేరుగా పరీక్షించలేరు లేదా నివేదించబడిన ఫలితాలను ధృవీకరించలేరు.
