“Friendly Fire” सुरक्षा अभ्यासाने असे दर्शवले की, केवळ README फाईलमध्ये एखादी घातक सूचना टाकून AI एजंटला फसवले जाऊ शकते आणि एजंट मूळ कोडकडे न पाहता त्या सूचनेचे पालन करेल. हीच त्रुटी एका वैयक्तिक ब्लॉग-ऑटोमेशन पाइपलाइनमध्ये दिसून आली, जी देखरेख नसलेल्या जनरेशन फेज दरम्यान 'auto-approve' फ्लॅगवर अवलंबून होती, ज्यामुळे एक छुपा अटॅक सरफेस (attack surface) उघड झाला.

Friendly Fire अभ्यास एका छुपा अटॅक वेक्टर उघड करतो

Friendly Fire पेपरमधील संशोधकांनी एक अत्यंत कमी पण शक्तिशाली एक्स्प्लॉइट (exploit) प्रदर्शित केला: एखादा हल्लेखोर डॉक्युमेंटेशन फाईलमध्ये अशी कमांड समाविष्ट करतो जी AI त्याच्या सामान्य वर्कफ्लोचा भाग म्हणून वाचते. एजंट फाईलच्या मजकुरावर विश्वास ठेवतो, म्हणून तो त्या लपविलेल्या कमांडची अंमलबजावणी एखाद्या कायदेशीर सूचनेप्रमाणे करतो. या हल्ल्यासाठी AI मॉडेल स्वतःशी छेडछाड करण्याची गरज नाही; मानवी देखरेख नसताना मॉडेल ज्या डेटावर प्रक्रिया करते, त्यावर प्रभाव टाकणे पुरेसे आहे.

या अभ्यासाचे मुख्य योगदान पेलोडमधील (payload) नाविन्य नसून, 'auto-approve' मोडचे वास्तव समोर आणणे हे आहे—म्हणजेच अशा सेटिंग्ज ज्या AI ला कोणतीही दुय्यम तपासणी न करता वाचलेल्या गोष्टींवर कृती करण्यास सांगतात—त्या बाह्य डेटा स्रोतांशी एक गर्भित विश्वास संबंध निर्माण करतात. जेव्हा हा विश्वास आंधळा असतो, तेव्हा ती पाइपलाइन 'arbitrary code execution' साठी एक प्रवेशद्वार बनते.

एका देखरेख नसलेल्या ब्लॉग पाइपलाइनचे कसे नुकसान झाले

अभ्यासाच्या लेखकाने हीच तर्कशास्त्र एका वैयक्तिक ब्लॉग-ऑटोमेशन सिस्टमला लागू केले. या वर्कफ्लोमध्ये तीन टप्पे आहेत:

  1. Generation stretch – कोणताही मानवी हस्तक्षेप न घेता AI लेख लिहिते.
  2. QA gate – एक स्वयंचलित क्वालिटी-स्कोर चेक आउटपुटचे मूल्यमापन करतो.
  3. Telegram button – पोस्ट प्रकाशित करण्यासाठी मानवाला एक बटण दाबावे लागते.

जनरेशन स्ट्रॅच दरम्यान लेखकाने dangerously-skip-permissions नावाचा फ्लॅग सक्षम केला होता, जो AI ला कोणताही इनपुट 'मंजूर' (approved) मानण्यास सांगतो. हा फ्लॅग प्रामुख्याने Friendly Fire पेपरमध्ये नमूद केलेल्या 'auto-approve' मोडची पुनरावृत्ती करतो.

नंतरच्या ऑडिटमध्ये एक मोठी त्रुटी समोर आली: जर एखादा हल्लेखोर त्या कालावधीत AI वाचत असलेल्या कोणत्याही फाईलवर प्रभाव टाकू शकला, तर तो संपूर्ण पाइपलाइन वळवू शकतो. लेखकाच्या स्वतःच्या सिस्टममध्ये सहापैकी पाच वेळा 'सायलेंट फेल्युअर' (silent failures) झाले, कारण एका कॉन्फिगरेशन स्क्रिप्टने नकळत दुसऱ्या स्क्रिप्टच्या सेटिंग्ज ओव्हरराईट केल्या होत्या. एक्झिट कोड्स (exit codes) किंवा QA स्कोअरचे लॉगिंग नसल्यामुळे, ही समस्या शोधण्यापूर्वी तीन दिवस तशीच राहिली.

ही घटना सिद्ध करते की सुरक्षा AI च्या आउटपुटवर विश्वास ठेवण्यापासून नाही, तर जनरेशन फेजच्या सभोवतालच्या तीन स्पष्ट चेकपॉइंट्समधून येते.

सुरक्षा खरोखर कुठे असते

अभ्यास आणि ब्लॉग-ऑटोमेशनमधील अपयश एकाच मुद्द्यावर येऊन थांबते: संरक्षण हे जनरेशन प्रक्रियेच्या बाहेर असले पाहिजे. जेव्हा AI 'auto-approve' स्थितीत काम करते, तेव्हा त्याला कोणत्याही वर्तनासाठी प्रवृत्त केले जाऊ शकते; केवळ सभोवतालचे नियंत्रणच नको असलेल्या कृती शोधू आणि रोखू शकते.

मुख्य निरीक्षणे:

  • शेवटी मानवी मंजुरी प्रभावी ठरते कारण ती अंतिम उत्पादनाची (artifact) तपासणी करते, मध्यवर्ती टप्प्यांची नाही जे रिअल-टाइम देखरेखीसाठी खूप वेगवान आणि असंख्य असतात.
  • जनरेशननंतर पण प्रकाशनापूर्वी लागू केलेले क्वालिटी थ्रेशोल्ड्स (Quality thresholds) कमी-आत्मविश्वास असलेले आउटपुट पकडतात, ज्यामध्ये फेरफार केले गेले असू शकते.
  • प्रत्येक एक्झिट कोड, QA स्कोअर आणि कॉन्फिगरेशन बदलाचे सर्वसमावेशक लॉगिंग (Comprehensive logging) केल्यामुळे सायलेंट फेल्युअर मोठ्या प्रमाणावर पसरण्यापूर्वी ते दृश्यमान होतात.

auto-approve एजंट्स चालवणाऱ्यांसाठी धडे

  1. सर्व काही लॉग करा – एक्झिट कोड्स, QA स्कोअर आणि कॉन्फिगरेशन फाईल्समधील कोणताही बदल नोंदवा. जे तुम्हाला दिसत नाही, ते तुम्ही सुधारू शकत नाही.
  2. कडक क्वालिटी गेट लागू करा – एक अटीतही न मोडण्यासारखे थ्रेशोल्ड सेट करा जे पाइपलाइन पुढील टप्प्यावर जाण्यापूर्वी पूर्ण करणे आवश्यक आहे.
  3. मानवी मंजुरी शेवटच्या टप्प्यासाठी राखून ठेवा – AI जनरेट करत असताना त्यावर लक्ष ठेवण्याचा प्रयत्न करणे अवास्तव आहे; सर्व तपासण्यांनंतर एक सिंगल बटण दाबणे अधिक विश्वसनीय आहे.
  4. कॉन्फिगरेशन फाईल्सचे संरक्षण करा – त्यांना इतर साधनांपासून वेगळे ठेवा जी सेटिंग्ज पुन्हा लिहू शकतात, आणि कोणत्याही 'राईट ॲक्सेस'चे (write access) नियमितपणे ऑडिट करा.

निष्कर्ष

देखरेख नसलेले AI एजंट्स तेवढेच सुरक्षित असतात जेवढे तुम्ही त्यांच्या सभोवतालचे अंतर (gaps) भरून काढता. 'auto-approve' फ्लॅग सुविधेचे रूपांतर एका शांत बॅकडोअरमध्ये करतो; सखोल लॉगिंग, कडक क्वालिटी गेट्स आणि मानवी अंतिम मंजुरी हे व्यावहारिक संरक्षण आहे जे पाइपलाइनला अटॅक वेक्टर बनण्यापासून वाचवते.