एक नया ओपन-सोर्स स्कैनर जो AI "एजेंट स्किल्स" (agent skills) का ऑडिट करता है, उसे एक टूल में बदला जा रहा है। यह कदम तब उठाया गया जब शोधकर्ताओं ने दिखाया कि एक अनवेरिफाइड (unverified) स्किल चुपचाप SSH कीज़ और क्लाउड क्रेडेंशियल्स चुरा सकती है। यह स्कैनर कीवर्ड फिल्टर, व्यवहार विश्लेषण (behavior analysis), AI-संचालित रीजनिंग, सैंडबॉक्स निष्पादन (sandbox execution) और चेंज-डिटेक्शन का मिश्रण है, ताकि AI-सहायता प्राप्त डेवलपर्स के खिलाफ सप्लाई-चेन हमलों की अगली लहर को रोका जा सके।

AI स्किल्स अब क्यों महत्वपूर्ण हैं

Claude और GitHub Copilot जैसे लार्ज-लैंग्वेज-मॉडल (LLM) असिस्टेंट अब "एजेंट स्किल्स" पर निर्भर करते हैं – ये छोटे, स्व-निहित (self-contained) फोल्डर होते हैं जो मॉडल को बताते हैं कि किसी विशिष्ट कार्य को कैसे करना है। GitHub ने हाल ही में एक वन-लाइन कमांड जोड़ी है जो डेवलपर्स को इन स्किल्स को सीधे सार्वजनिक रिपॉजिटरी से प्राप्त करने की अनुमति देती है, जिससे वे AI-संचालित वर्कफ़्लो के लिए एक डी-फ़ैक्टो (de-facto) पैकेज मैनेजर बन गए हैं।

इसकी सुविधा निर्विवाद है: एक स्किल "इस स्प्रेडशीट को साफ करें" जैसे अस्पष्ट अनुरोध को सटीक API कॉल, फ़ाइल हेरफेर या कोड संपादन में बदल सकती है। यही सरलता दुर्भावनापूर्ण (malicious) कोड को भी बंडल में घुसने का मौका देती है।

GitHub का चेतावनी पेज बताता है कि स्किल्स को इंस्टॉल करने से पहले वेरिफाई नहीं किया जाता है।

एक छिपा हुआ पेलोड कैसे नज़र से बच सकता है

एक सामान्य बाइनरी के विपरीत, एक AI स्किल एक साथ लोड नहीं होती है। मॉडल पहले एक संक्षिप्त सारांश पढ़ता है, और फिर पूरा निर्देश सेट (instruction set) तभी प्राप्त करता है जब कार्य प्रासंगिक लगता है। यह चरणबद्ध लोडिंग एक ऐसा अवसर (window) बनाती है जहाँ एक दुर्भावनापूर्ण फ़ाइल उपयोगकर्ता को दिखाई दिए बिना निष्क्रिय रह सकती है, जब तक कि मॉडल उसे चलाने का निर्णय न ले ले।

एक प्रूफ-ऑफ-कॉन्सेप्ट प्रयोग में, शोधकर्ता ने csv-formatter नामक एक फर्जी स्किल बनाई, जिसने स्प्रेडशीट क्लीनअप का विज्ञापन किया। दिखने वाला कोड हानिरहित लग रहा था, लेकिन एक छिपे हुए निर्देश ने एक "डायग्नोस्टिक स्टेप" जोड़ दिया था। उस स्टेप ने कुछ भी डायग्नोस नहीं किया; बल्कि उसने होस्ट में SSH प्राइवेट कीज़ और AWS एक्सेस टोकन को स्कैन किया, और फिर उन निष्कर्षों को एक बाहरी सर्वर पर पोस्ट कर दिया।

दुर्भावनापूर्ण कमांड एक चेंजलॉग (changelog) फ़ाइल में भी दिखाई दिया – एक ऐसी जगह जिसे अधिकांश मनुष्य कभी नहीं देखते, लेकिन AI वर्जन हिस्ट्री का मूल्यांकन करते समय इसे पढ़ता है। AI ने चुपचाप क्रेडेंशियल-चोरी की प्रक्रिया को अंजाम दिया, जबकि डेवलपर को लगा कि स्किल केवल डेटा फॉर्मेट कर रही है।

ओपन-सोर्स प्रतिक्रिया

इस अंतर को पाटने के लिए, शोधकर्ता ने डिटेक्शन लॉजिक को एक ओपन-सोर्स ऑडिटिंग टूल में पैक कर दिया है। यह स्कैनर किसी एक तकनीक पर निर्भर नहीं है; यह कई सुरक्षा परतों (defenses) का उपयोग करता है:

  • Keyword matching उन स्पष्ट और लापरवाह प्रयासों को पकड़ता है जिनमें ज्ञात दुर्भावनापूर्ण स्ट्रिंग्स (malicious strings) शामिल होती हैं।
  • Behavior analysis उन निर्देशों को फ्लैग करता है जो क्रेडेंशियल फ़ाइलों को पढ़ते हैं और फिर नेटवर्क कॉल करते हैं।
  • AI reasoning यह मूल्यांकन करने के लिए एक सेकेंडरी मॉडल चलाता है कि क्या स्किल के निर्देश जानबूझकर उपयोगकर्ता से छिपाए गए हैं।
  • Sandboxing स्किल को एक अलग (isolated) वातावरण में चलाता है, जिससे होस्ट सिस्टम को जोखिम में डाले बिना वास्तविक समय की गतिविधियों का अवलोकन किया जा सके।
  • Change detection भरोसेमंद स्किल्स में अप्रत्याशित बदलावों की निगरानी करता है, और नया वर्जन इंस्टॉल होने से पहले मेंटेनर्स को अलर्ट करता है।

लेखक एक टेस्ट सूट शामिल करेंगे जो csv-formatter हमले को दोहराता है, और एक पब्लिक बेंचमार्क भी शामिल करेंगे जो हानिरहित (benign) और दुर्भावनापूर्ण स्किल्स के एक क्यूरेटेड सेट में डिटेक्शन रेट को मापता है।

आगे क्या देखने की ज़रूरत है

  • Community benchmarks: जैसे-जैसे अधिक शोधकर्ता दुर्भावनापूर्ण स्किल सैंपल प्रकाशित करेंगे, पब्लिक बेंचमार्क को प्रासंगिक बने रहने के लिए नियमित अपडेट की आवश्यकता होगी।

AI एजेंट स्किल्स का उदय डेवलपर टूलिंग में एक नया मोर्चा है, लेकिन यह सप्लाई-चेन हमलों के लिए भी एक दरवाज़ा खोलता है जो पारंपरिक कोड समीक्षाओं (code reviews) को बायपास कर सकते हैं। एक ओपन-सोर्स स्कैनर जो स्टैटिक चेक, डायनेमिक ऑब्जर्वेशन और AI रीजनिंग का मिश्रण है, रक्षा की एक व्यावहारिक पहली पंक्ति (first line of defense) प्रदान करता है। जो डेवलपर्स किसी स्किल को एक रैंडम USB ड्राइव की तरह मानते हैं, उन्हें जल्द ही पता चलेगा कि वेरिफिकेशन को नज़रअंदाज़ करने की कीमत तत्काल AI सहायता की सुविधा से कहीं अधिक है।