ओपन-सोर्स AI एक विशाल इकोसिस्टम में बदल गया है जहाँ एक अकेला प्रोडक्ट दर्जनों रिपॉजिटरीज़ से कोड ले सकता है, कई स्रोतों से ट्रेनिंग डेटा पर निर्भर हो सकता है, और ऐसे विशेष हार्डवेयर कॉन्फ़िगरेशन पर चल सकता है जिनका दस्तावेज़ीकरण बहुत कम टीमें पूरी तरह से कर पाती हैं। इन डिपेंडेंसीज़ का ट्रैक रखना कठिन है। उस स्टैक के कौन से हिस्से इंटरनेट के लिए खुले हैं, यह समझना और भी कठिन है। Current AI द्वारा जारी Open Source AI Gap Map v0.1 इस अराजकता में कुछ व्यवस्था लाने का प्रयास करता है, और सुरक्षा टीमों को इसे अनिवार्य रूप से पढ़ना चाहिए।
यह इंडेक्स 421 ओपन-सोर्स AI प्रोडक्ट्स को सूचीबद्ध करता है। यह उन्हें चार श्रेणियों में विभाजित करता है: AI मॉडल्स, डेटासेट्स, सॉफ्टवेयर टूल्स और हार्डवेयर। इसके पीछे, पूरा प्रोजेक्ट 1,184 YAML फ़ाइलों पर चलता है जो 16,000 से अधिक GitHub रिपॉजिटरीज़ को ट्रैक करती हैं। 421 प्रोडक्ट्स और 16,000 रिपॉजिटरीज़ के बीच का यह अंतर अपनी कहानी खुद कहता है। अधिकांश AI एप्लिकेशन आत्मनिर्भर मोनोलिथ (monoliths) नहीं हैं। वे इन्फरेंस इंजन, फाइन-ट्यूनिंग स्क्रिप्ट्स, डेटा लोडर्स, इवैल्यूएशन बेंचमार्क और ड्राइवर लेयर्स का एक संयोजन हैं, जिनमें से प्रत्येक अपने स्वयं के रिपॉजिटरी, अपने स्वयं के मेंटेनर, कमिट हिस्ट्री और वल्नरेबिलिटी प्रोफाइल के साथ मौजूद है।
Current AI ने इस डेटासेट को MIT लाइसेंस के तहत प्रकाशित किया है और इसे पूरी तरह से सार्वजनिक कर दिया है। यही खुलापन इसका मुख्य उद्देश्य है। कोई भी इसे डाउनलोड कर सकता है, YAML को पार्स कर सकता है और इसके ऊपर टूलिंग बना सकता है। रक्षकों (defenders) के लिए, यह सुलभता एक अवसर है। हमलावरों (attackers) के लिए, यह समान रूप से सुविधाजनक है।
यह मैप वास्तव में क्या ट्रैक करता है
AI का उपयोग करने वाले अधिकांश संगठनों के पास इस बात का स्पष्ट इन्वेंट्री नहीं होता है कि उन्होंने क्या तैनात (deploy) किया है। एक टीम किसी लोकप्रिय हब से लैंग्वेज मॉडल डाउनलोड कर सकती है, उसे चलाने के लिए कुछ Python पैकेज इंस्टॉल कर सकती है, और काम पूरा समझ सकती है। लेकिन उस सरल वर्कफ़्लो के नीचे डिपेंडेंसीज़ का एक नेस्टेड सेट होता है। मॉडल वेट्स (weights) एक रिपॉजिटरी से आते हैं। टोकनाइज़र कॉन्फ़िगरेशन किसी दूसरी रिपॉजिटरी से आता है। इन्फरेंस फ्रेमवर्क किसी तीसरे प्रोजेक्ट का फोर्क (fork) हो सकता है। CUDA ड्राइवर्स और कंटेनर इमेजेस और भी कई स्रोतों से आते हैं।
Gap Map इसे 421 अलग-अलग AI प्रोडक्ट्स के इर्द-गिर्द अपनी 1,184 YAML फ़ाइलों को व्यवस्थित करके कैप्चर करता है। यहाँ मैप की गई 16,000 से अधिक GitHub रिपॉजिटरीज़ उस वास्तविक कोड, कॉन्फ़िगरेशन और आर्टिफैक्ट्स का प्रतिनिधित्व करती हैं जो उन प्रोडक्ट्स को कार्यशील बनाते हैं। प्रविष्टियों को मॉडल्स, डेटासेट्स, सॉफ्टवेयर टूल्स और हार्डवेयर में अलग करके, यह इंडेक्स एक बुनियादी सवाल पूछता है: क्या आप जानते हैं कि आपके सिस्टम वास्तव में इनमें से किन चार लेयर्स को छूते हैं?
यदि आप प्रोडक्शन में एक ओपन-सोर्स लार्ज लैंग्वेज मॉडल चला रहे हैं, तो संभावना है कि आप चारों को छू रहे हैं। आप मॉडल वेट्स और आर्किटेक्चर पर निर्भर हैं। आप उन डेटासेट्स पर निर्भर हैं जिनका उपयोग प्री-ट्रेनिंग या फाइन-ट्यूनिंग के लिए किया गया है, भले ही आपने उन्हें सीधे कभी डाउनलोड न किया हो। आप मॉडल को कन्वर्ट, क्वांटाइज़ या सर्व करने के लिए सॉफ्टवेयर टूल्स पर निर्भर हैं। और यदि आप GPUs या विशेष एक्सेलेरेटर्स पर चल रहे हैं, तो आप फर्मवेयर और ड्राइवर स्टैक पर निर्भर हैं जो हार्डवेयर श्रेणी के अंतर्गत आते हैं।
सुरक्षा की दोधारी तलवार
यह डेटासेट दो पक्षों की सेवा करता है, और सुरक्षा प्रमुखों को दोनों पक्षों को समझने की आवश्यकता है।
रक्षात्मक पक्ष (defensive side) पर, Gap Map आपकी AI सप्लाई चेन के लिए एक फोन बुक की तरह काम करता है। आप इस इंडेक्स के विरुद्ध उन रिपॉजिटरीज़ और टूल्स की तुलना कर सकते हैं जिन पर आपका संगठन निर्भर है और अपनी विजिबिलिटी में कमियों (gaps) का पता लगा सकते हैं। यदि मैप में कोई महत्वपूर्ण रिपॉजिटरी दिखाई देती है लेकिन आपके सॉफ्टवेयर बिल ऑफ मटेरियल्स (SBOM) में नहीं, तो आपने संभवतः शैडो AI इंफ्रास्ट्रक्चर खोज लिया है। किसी हमलावर द्वारा इसे खोजने से पहले यह जानना महत्वपूर्ण है।
आक्रामक पक्ष (offensive side) पर, यह डेटासेट रेकनाइसेंस (reconnaissance) के लिए सोना है। हमलावर लगातार उजागर AI इंफ्रास्ट्रक्चर, मॉडल सर्विंग एंडपॉइंट्स और लोकप्रिय ML पाइपलाइनों में कमजोर डिपेंडेंसीज़ की तलाश करते रहते हैं। Gap Map उन्हें लक्ष्यों की एक मशीन-रीडेबल, स्ट्रक्चर्ड सूची देता है जो ठीक उन्हीं श्रेणियों में व्यवस्थित होती है जिनकी उन्हें परवाह है। एक सिंगल YAML पार्सर हजारों रिपॉजिटरी URL निकाल सकता है, और वहां से एक हमलावर ज्ञात कमजोरियों (vulnerabilities) के साथ क्रॉस-रेफरेंस कर सकता है, गलत कॉन्फ़िगर किए गए सार्वजनिक इंस्टेंस की तलाश कर सकता है, या डिपेंडेंसी कन्फ्यूजन हमलों के लिए उच्च-मूल्य वाले लक्ष्यों की पहचान कर सकता है।
क्योंकि डेटा MIT-लाइसेंस प्राप्त और सार्वजनिक है, इसलिए इसमें प्रवेश की कोई बाधा नहीं है। कोई सब्सक्रिप्शन नहीं, कोई अनुमोदन प्रक्रिया नहीं। यह डिज़ाइन विकल्प शोधकर्ताओं और रक्षकों के लिए उपयोगिता को अधिकतम करता है, लेकिन यह खतरे पैदा करने वाले तत्वों (threat actors) के लिए भी उपयोगिता को अधिकतम करता है। वही फ़ाइल जो आपके स्टैक को मजबूत करने में आपकी मदद करती है, वह किसी और को टारगेट लिस्ट बनाने में मदद करती है।
इस जानकारी के साथ क्या करें
इस डेटासेट के साथ बिल्कुल वैसा ही व्यवहार करें जैसा आप एक थ्रेट इंटेलिजेंस फीड के साथ करेंगे। इसे बुकमार्क करके भूल न जाएं। अपने वातावरण के विरुद्ध एक सक्रिय जांच (active check) चलाएं।
सबसे पहले उन सभी ओपन-सोर्स AI कंपोनेंट्स की एक सूची निकालें जिनका आपकी टीमें वर्तमान में उपयोग कर रही हैं। केवल स्पष्ट चीज़ों तक ही सीमित न रहें। पूछें कि आपके tokenizers, evaluation scripts, quantization libraries और container base images किस repositories से आते हैं। फिर उन repositories की तुलना Gap Map में ट्रैक किए गए 16,000 repositories से करें। यदि आपको मिलान मिलता है, तो आपने पुष्टि कर ली है कि आपकी dependencies ओपन-सोर्स AI जगत के सबसे प्रमुख रूप से इंडेक्स किए गए कोनों में से एक में स्थित हैं। यह प्रमुखता दोधारी तलवार की तरह है। इसका मतलब आमतौर पर सक्रिय रखरखाव और सामुदायिक जांच (community scrutiny) होता है, लेकिन इसका यह भी अर्थ है कि हमलावरों को पता है कि ये repositories मौजूद हैं।
इसके बाद, YAML स्ट्रक्चर को ही देखें। 1,184 फ़ाइलों में से प्रत्येक उत्पादों को एक मानकीकृत प्रारूप (standardized format) में उनकी अंतर्निहित repositories से जोड़ती है। आप अपने dependency manifests, package lists, या SBOM exports की इन मैपिंग के साथ तुलना करने के लिए एक सरल स्क्रिप्ट लिख सकते हैं। यदि आपको पता चलता है कि आपका production stack उन repositories पर निर्भर है जिनके बारे में आपने कभी नहीं सुना था, तो गहराई से जांच करें। अज्ञात dependencies ही वह जगह हैं जहाँ supply chain attacks छिपे होते हैं।
हार्डवेयर लेयर पर विशेष ध्यान दें। सुरक्षा टीमें अक्सर सॉफ्टवेयर और मॉडल्स पर ध्यान केंद्रित करती हैं, जबकि ड्राइवर्स और फर्मवेयर को बैकग्राउंड शोर (background noise) मानकर नज़रअंदाज़ कर देती हैं। Gap Map स्पष्ट रूप से हार्डवेयर से संबंधित repositories को इंडेक्स करता है, जो आपको याद दिलाना चाहिए कि GPU driver stacks, compiler toolchains और accelerator firmware भी कोड ही हैं। इनमें बग्स (bugs) होते हैं। इन्हें अपडेट किया जाता है। और जब ये आउट-ऑफ-डेट होते हैं, तो ये आपके पाइपलाइन में सबसे आसान लक्ष्य बन सकते हैं।
अंत में, इसका उपयोग करें
