ओपन-सोर्स समुदायाकडे आता प्रॉम्प्ट-इंजेक्शन (prompt-injection) हल्ल्यांपासून लार्ज लँग्वेज मॉडेल्सचे (LLMs) संरक्षण करण्यासाठी पहिले फेडरेटेड थ्रेट-इंटेल फीड (federated threat-intel feed) उपलब्ध आहे. prompt-shield v0.6.0 सोबत रिलीज करण्यात आलेले हे फीड ५६ क्युरेटेड अटॅक सिग्नेचर्स (attack signatures) प्रदान करते, ज्यापैकी प्रत्येक सिग्नेचर ed25519 की (key) ने स्वाक्षरी केलेली आहे आणि ते एका हलक्या वजनाच्या Python क्लायंटद्वारे मोफत CDN मधून मिळवता येते.
LLM संरक्षणाकडे सामायिक इंटेल स्त्रोत का नव्हता
पारंपारिक सुरक्षा स्तर सार्वजनिक आणि नियमितपणे अपडेट केल्या जाणाऱ्या सिग्नेचर्सवर अवलंबून असतात. वेब-ॲप्लिकेशन फायरवॉल्स OWASP पॅटर्न वापरतात; अँटीव्हायरस प्रोग्राम्स ClamAV अपडेट्स स्वीकारतात. हे फीड संरक्षणाला अद्ययावत ठेवतात. याउलट, LLM सुरक्षा साधने विलगपणे (isolation मध्ये) काम करतात, जिथे प्रत्येक विक्रेता किंवा संशोधक घातक प्रॉम्प्ट्सची स्वतःची खाजगी यादी ठेवतो.
ही दरी तांत्रिक नाही. व्यावसायिक विक्रेते थ्रेट डेटाला एक उत्पादन मानतात, म्हणून ते तो बंद (closed) ठेवतात. मोठ्या संशोधन गटांकडे सार्वजनिक फीडसाठी आवश्यक असलेले "कंटाळवाणे" इन्फ्रास्ट्रक्चर चालवण्यासाठी पुरेशी क्षमता (bandwidth) नसते. सध्याचे व्हॅलिडेटर मार्केटप्लेस हे वन-वे हब म्हणून काम करतात, जे रिअल-टाइम, समुदाय-चालित स्ट्रीम ऐवजी केवळ स्टॅटिक अपडेट्स पाठवतात. परिणामी: संरक्षणाचे स्वरूप विखुरलेले राहते, ज्यामुळे नवीन प्रॉम्प्ट-इंजेक्शन तंत्रे नळळता निसटतात.
नवीन फीड कसे काम करते
हा प्रकल्प एका सार्वजनिक GitHub रिपॉझिटरीवर उपलब्ध आहे आणि त्यात तीन फाइल्स आहेत:
- signatures.json – ५६ अटॅक सिग्नेचर्स, ज्यामध्ये प्रत्येक सिग्नेचर LLM चा आउटपुट हायजॅक करू शकणाऱ्या पॅटर्नचे वर्णन करते.
- signatures.json.minisig – एक ed25519 सिग्नेचर जे JSON फाईलला मेंटेनरच्या प्रायव्हेट कीशी जोडते.
- public.key – पब्लिक की, ज्याचा वापर क्लायंट लायब्ररी सिग्नेचर पडताळण्यासाठी करतात.
२०० ओळींचा एक pure-Python क्लायंट JSON मिळवतो, पब्लिक कीच्या मदतीने minisig तपासतो आणि कोणतेही नवीन नियम prompt-shield इंजिनमध्ये समाविष्ट करतो. जर पडताळणी अयशस्वी झाली, तर क्लायंट शेवटच्या ज्ञात-चांगल्या (known-good) कॅशेचा वापर करतो, जेणेकरून अविश्वसनीय डेटा कधीही सुरक्षा थरापर्यंत पोहोचणार नाही.
तीन डिझाइन स्तंभ या फीडला वेगळे ठरवतात:
- Zero telemetry – क्लायंट फक्त एक HTTP GET विनंती करतो; तो कधीही आयडेंटिफायर्स, API की किंवा वापराचे मेट्रिक्स पाठवत नाही.
- Cryptographic verification – कोणीही फीड डाउनलोड करू शकते, परंतु मेंटेनरच्या प्रायव्हेट कीने स्वाक्षरी केलेला डेटाच स्वीकारला जातो.
- Fail-safe behavior – एखादी सिग्नेचर खराब झाली तरी शील्ड बंद पडत नाही; सिस्टम फक्त पूर्वीच्या पडताळणी केलेल्या नियमांचा वापर सुरू ठेवते.
ही सिग्नेचर्स अनेक प्रतिष्ठित स्त्रोतांतून घेतली आहेत: NVIDIA चा Garak red-team corpus, OWASP LLM Top 10 उदाहरणे, HackerOne वरील सार्वजनिक खुलासे आणि मेंटेनरने तपासलेले समुदाय सबमिशन.
कोणाला फायदा होईल आणि काय धोक्याचे आहे
LLM-आधारित ॲप्स तयार करणाऱ्या डेव्हलपर्सकडे आता प्रॉम्प्ट-इंजेक्शन पॅटर्नचा एक मोफत आणि पडताळण्यायोग्य स्त्रोत उपलब्ध आहे, जो एकाच कमांडने (pip install prompt-shield-ai) समाविष्ट करता येतो. ज्या संस्था पूर्वी प्रोप्रायटरी (proprietary) आणि क्लोज्ड-सोर्स इंटेलवर अवलंबून होत्या, त्या आता या समुदाय-शासित पर्यायाने त्या फीड्सना अधिक सक्षम करू शकतात किंवा त्यांची जागा घेऊ शकतात.
या प्रकल्पाचा "bus factor"—ज्या व्यक्तींच्या उपलब्धतेअभावी प्रकल्प ठप्प होऊ शकतो अशी संख्या—सध्या एक आहे. जर मेंटेनरने अपडेट्सवर स्वाक्षरी करणे थांबवले, तर फीड स्थिर होईल आणि वापरकर्त्यांना नवीन सिग्नेचर्स मिळणार नाहीत. लेखकाने रिपॉझिटरी सह-व्यवस्थापित करण्यासाठी अतिरिक्त इंजिनिअर्सची स्पष्टपणे मागणी केली आहे, जेणेकरून या वैयक्तिक प्रयत्नाचे रूपांतर एका शाश्वत सामुदायिक मालमत्तेत होईल.
निष्कर्ष: LLM प्रॉम्प्ट इंजेक्शनसाठी सार्वजनिकरित्या पडताळण्यायोग्य आणि समुदाय-चालित थ्रेट-इंटेल फीड आता उपलब्ध आहे, जो प्रोप्रायटरी सोल्यूशन्सना एक कमी खर्चिक आणि पारदर्शक पर्याय प्रदान करतो—जर समुदायाने तो जिवंत आणि संबंधित ठेवण्यासाठी पुढाकार घेतला तर.
