"Friendly Fire" सुरक्षा अध्ययन ने दिखाया कि एक AI एजेंट को केवल README फ़ाइल में एक दुर्भावनापूर्ण निर्देश डालकर धोखा दिया जा सकता है, और एजेंट बिना अंतर्निहित कोड को देखे ही उसका पालन कर देगा। यही खामी एक व्यक्तिगत ब्लॉग-ऑटोमेशन पाइपलाइन में भी सामने आई जो बिना किसी निगरानी वाले जनरेशन चरण के दौरान एक "auto-approve" फ्लैग पर निर्भर थी, जिससे एक छिपा हुआ अटैक सरफेस उजागर हो गया।

Friendly Fire अध्ययन एक छिपे हुए अटैक वेक्टर को उजागर करता है

Friendly Fire पेपर के शोधकर्ताओं ने एक न्यूनतम लेकिन शक्तिशाली एक्सप्लॉइट का प्रदर्शन किया: एक हमलावर एक डॉक्यूमेंटेशन फ़ाइल में एक कमांड डाल देता है जिसे AI अपने सामान्य वर्कफ़्लो के हिस्से के रूप में पढ़ता है। क्योंकि एजेंट फ़ाइल की सामग्री पर भरोसा करता है, वह छिपे हुए कमांड को एक वैध निर्देश की तरह ही निष्पादित करता है। इस हमले के लिए AI मॉडल को स्वयं कॉम्प्रोमाइज करने की आवश्यकता नहीं है; इसे केवल उस डेटा को प्रभावित करने की आवश्यकता है जिसे मॉडल प्रोसेस करता है जबकि कोई इंसान उसे देख नहीं रहा होता है।

अध्ययन का मुख्य योगदान पेलोड की नवीनता नहीं है, बल्कि यह खुलासा है कि "auto-approve" मोड—ऐसी सेटिंग्स जो AI को बिना किसी माध्यमिक जांच के जो कुछ भी वह पढ़ता है उस पर कार्य करने के लिए कहती हैं—बाहरी डेटा स्रोतों के साथ एक अंतर्निहित विश्वास संबंध (implicit trust relationship) बनाती हैं। जब वह विश्वास अंधा होता है, तो पाइपलाइन मनमाने कोड निष्पादन (arbitrary code execution) के लिए एक द्वार बन जाती है।

एक अनसुपरवाइज्ड ब्लॉग पाइपलाइन कैसे विफल हुई

अध्ययन के लेखक ने इसी तर्क को एक व्यक्तिगत ब्लॉग-ऑटोमेशन सिस्टम पर लागू किया। वर्कफ़्लो में तीन चरण शामिल हैं:

  1. Generation stretch – AI बिना किसी मानवीय निरीक्षण के लेख लिखता है।
  2. QA gate – एक स्वचालित गुणवत्ता-स्कोर चेक आउटपुट का मूल्यांकन करता है।
  3. Telegram button – पोस्ट प्रकाशित करने के लिए एक इंसान को बटन दबाना होगा।

जनरेशन स्ट्रेच के दौरान लेखक ने dangerously-skip-permissions नामक एक फ्लैग सक्षम किया था, जो AI को किसी भी इनपुट को स्वीकृत मानने के लिए कहता है। यह फ्लैग अनिवार्य रूप से Friendly Fire पेपर में बताए गए "auto-approve" मोड की नकल करता है।

बाद के ऑडिट में एक व्यापक कमी का पता चला: यदि कोई हमलावर उस विंडो में AI द्वारा पढ़ी जाने वाली किसी भी फ़ाइल को प्रभावित कर सकता है, तो वे पूरे पाइपलाइन को मोड़ सकते हैं। लेखक के अपने सिस्टम में छह में से पांच बार मौन विफलताएं (silent failures) हुईं क्योंकि एक कॉन्फ़िगरेशन स्क्रिप्ट ने अनजाने में दूसरी स्क्रिप्ट की सेटिंग्स को ओवरराइट कर दिया था। एग्जिट कोड या QA स्कोर की लॉगिंग न होने के कारण, पता चलने से पहले तीन दिनों तक समस्या बनी रही।

यह घटना साबित करती है कि सुरक्षा AI के आउटपुट पर भरोसा करने से नहीं, बल्कि जनरेशन चरण के आसपास के तीन स्पष्ट चेकपॉइंट्स से आई थी।

सुरक्षा वास्तव में कहाँ रहती है

अध्ययन और ब्लॉग-ऑटोमेशन की विफलता एक ही बिंदु पर आकर मिलती है: सुरक्षा जनरेशन प्रक्रिया के बाहर होनी चाहिए। जब AI ऑटो-अप्रूव स्थिति में काम करता है, तो उसे किसी भी व्यवहार के लिए उकसाया जा सकता है; केवल आसपास के नियंत्रण ही अवांछित कार्यों का पता लगा सकते हैं और उन्हें रोक सकते हैं।

मुख्य अवलोकन:

  • अंत में मानवीय अनुमोदन (Human approval at the end) काम करता है क्योंकि यह अंतिम आर्टिफैक्ट की समीक्षा करता है, न कि उन मध्यवर्ती चरणों की जो वास्तविक समय की निगरानी के लिए बहुत तेज़ और बहुत अधिक हैं।
  • गुणवत्ता सीमाएं (Quality thresholds) जनरेशन के बाद लेकिन प्रकाशन से पहले लागू की जाती हैं, जो कम-विश्वास वाले आउटपुट को पकड़ लेती हैं जिन्हें मैनिपुलेट किया गया हो सकता है।
  • प्रत्येक एग्जिट कोड, QA स्कोर और कॉन्फ़िगरेशन परिवर्तन की व्यापक लॉगिंग (Comprehensive logging) मौन विफलताओं को उनके बढ़ने से पहले ही दृश्यमान बना देती है।

ऑटो-अप्रूव एजेंट चलाने वाले किसी भी व्यक्ति के लिए सबक

  1. सब कुछ लॉग करें – एग्जिट कोड, QA स्कोर और कॉन्फ़िगरेशन फ़ाइलों में किसी भी बदलाव को कैप्चर करें। आप उसे ठीक नहीं कर सकते जिसे आप देख नहीं सकते।
  2. एक सख्त क्वालिटी गेट लागू करें – एक गैर-परक्राम्य (non-negotiable) सीमा निर्धारित करें जिसे पाइपलाइन के अगले चरण में आगे बढ़ने से पहले पूरा किया जाना चाहिए।
  3. अंतिम चरण के लिए मानवीय अनुमोदन सुरक्षित रखें – AI के जनरेट करते समय उसे देखने की कोशिश करना अवास्तविक है; सभी जांचों के बाद एक सिंगल बटन प्रेस कहीं अधिक विश्वसनीय है।
  4. कॉन्फ़िगरेशन फ़ाइलों की रक्षा करें – उन्हें अन्य टूल्स से अलग रखें जो सेटिंग्स को फिर से लिख सकते हैं, और नियमित रूप से किसी भी राइट एक्सेस (write access) का ऑडिट करें।

निष्कर्ष

बिना निगरानी वाले AI एजेंट केवल उतने ही सुरक्षित हैं जितने कि उनके आसपास के वे अंतराल जिन्हें आप सुरक्षित करते हैं। एक "auto-approve" फ्लैग सुविधा को एक मौन बैकडोर में बदल देता है; गहन लॉगिंग, सख्त क्वालिटी गेट और अंतिम मानवीय साइन-ऑफ वे व्यावहारिक बचाव हैं जो पाइपलाइन को अटैक वेक्टर बनने से रोकते हैं।