ઓપન-સોર્સ સમુદાય પાસે હવે પ્રોમ્પ્ટ-ઇન્જેક્શન (prompt-injection) હુમલાઓ સામે લાર્જ લેંગ્વેજ મોડલ્સ (LLMs) ને બચાવવા માટે તેનું પ્રથમ ફેડરેટેડ થ્રેટ-ઇન્ટેલ ફીડ (federated threat-intel feed) ઉપલબ્ધ છે. prompt-shield v0.6.0 સાથે રિલીઝ કરવામાં આવેલ આ ફીડમાં 56 ક્યુરેટેડ એટેક સિગ્નેચર્સ (attack signatures) છે, જેમાંથી દરેક ed25519 કી સાથે સાઇન કરેલ છે, અને તેને લાઇટવેઇટ Python ક્લાયન્ટ દ્વારા મફત CDN પરથી મેળવી શકાય છે.
LLM સુરક્ષામાં શા માટે સહિયારા ઇન્ટેલ સોર્સનો અભાવ રહ્યો છે
પરંપરાગત સુરક્ષા સ્તરો જાહેર અને નિયમિતપણે અપડેટ થતી સિગ્નેચર્સ પર આધારિત હોય છે. Web-application firewalls OWASP પેટર્નનો ઉપયોગ કરે છે; એન્ટીવાયરસ પ્રોગ્રામ્સ ClamAV અપડેટ્સ લે છે. આ ફીડ્સ સુરક્ષાને વર્તમાન સાથે રાખે છે. તેનાથી વિપરીત, LLM સુરક્ષા સાધનો અલગ-અલગ રીતે કામ કરે છે, જેમાં દરેક વેન્ડર અથવા સંશોધક દૂષિત પ્રોમ્પ્ટ્સની ખાનગી યાદી જાળવી રાખે છે.
આ ખામી ટેકનિકલ નથી. કોમર્શિયલ વેન્ડર્સ થ્રેટ ડેટાને એક પ્રોડક્ટ તરીકે જુએ છે, તેથી તેઓ તેને બંધ રાખે છે. મોટા સંશોધન જૂથો પાસે જાહેર ફીડ માટે જરૂરી "બોરિંગ" ઇન્ફ્રાસ્ટ્રક્ચર ચલાવવા માટે પૂરતા સંસાધનો (bandwidth) હોતા નથી. હાલના વેલિડેટર માર્કેટપ્લેસ વન-વે હબ તરીકે કામ કરે છે, જે રિયલ-ટાઇમ, સમુદાય-સંચાલિત સ્ટ્રીમ આપવાને બદલે સ્ટેટિક અપડેટ્સ મોકલે છે. પરિણામ: એક વિખરાયેલું ડિફેન્સ સપાટી (fragmented defense surface) જ્યાં પ્રોમ્પ્ટ-ઇન્જેક્શનની નવી તકનીકો અજાણતામાં છૂટી જાય છે.
નવું ફીડ કેવી રીતે કામ કરે છે
આ પ્રોજેક્ટ પબ્લિક GitHub રિપોઝિટરી પર છે અને તેમાં ત્રણ ફાઇલો સામેલ છે:
- signatures.json – 56 એટેક સિગ્નેચર્સ, જેમાંથી દરેક એક એવા પેટર્નનું વર્ણન કરે છે જે LLM ના આઉટપુટને હાઇજેક કરી શકે છે.
- signatures.json.minisig – એક ed25519 સિગ્નેચર જે JSON ફાઇલને મેન્ટેનરની પ્રાઇવેટ કી સાથે જોડે છે.
- public.key – પબ્લિક કી જેનો ઉપયોગ ક્લાયન્ટ લાઇબ્રેરીઓ સિગ્નેચર વેરિફાય કરવા માટે કરે છે.
200-લાઇનનો પ્યોર-Python ક્લાયન્ટ JSON મેળવે છે, પબ્લિક કી સામે minisig તપાસે છે, અને કોઈપણ નવા નિયમોને prompt-shield એન્જિનમાં જોડે છે. જો વેરિફિકેશન નિષ્ફળ જાય, તો ક્લાયન્ટ છેલ્લે જાણીતા સુરક્ષિત કેશ (cache) નો ઉપયોગ કરે છે, જેથી અવિશ્વસનીય ડેટા ક્યારેય ડિફેન્સ લેયર સુધી પહોંચતો નથી.
ત્રણ ડિઝાઇન પિલર્સ આ ફીડને અલગ પાડે છે:
- Zero telemetry – ક્લાયન્ટ માત્ર એક જ HTTP GET રિક્વેસ્ટ કરે છે; તે ક્યારેય આઇડેન્ટિફાયર્સ, API કી અથવા વપરાશના મેટ્રિક્સ મોકલતું નથી.
- Cryptographic verification – કોઈપણ વ્યક્તિ ફીડ ડાઉનલોડ કરી શકે છે, પરંતુ માત્ર મેન્ટેનરની પ્રાઇવેટ કી સાથે સાઇન કરેલ ડેટા જ સ્વીકારવામાં આવે છે.
- Fail-safe behavior – જો સિગ્નેચર ખામીયુક્ત હોય તો પણ તે શીલ્ડને નિષ્ક્રિય કરતું નથી; સિસ્ટમ ફક્ત અગાઉ વેરિફાય કરેલા નિયમોનો ઉપયોગ કરવાનું ચાલુ રાખે છે.
આ સિગ્નેચર્સ વિવિધ પ્રતિષ્ઠિત સ્ત્રોતોમાંથી લેવામાં આવી છે: NVIDIA નું Garak red-team corpus, OWASP LLM Top 10 ના ઉદાહરણો, HackerOne પર જાહેર થયેલી વિગતો, અને મેન્ટેનર દ્વારા તપાસવામાં આવેલ સમુદાયના સબમિશન.
કોને ફાયદો થશે અને શું જોખમ છે
LLM-સંચાલિત એપ્સ બનાવતા ડેવલપર્સ પાસે હવે પ્રોમ્પ્ટ-ઇન્જેક્શન પેટર્નનો મફત અને વેરિફાઇએબલ સ્ત્રોત છે જે એક જ કમાન્ડ (pip install prompt-shield-ai) સાથે ઇન્ટિગ્રેટ થઈ શકે છે. જે સંસ્થાઓ અગાઉ પ્રોપ્રાઇટરી (proprietary) અને ક્લોઝડ-સોર્સ ઇન્ટેલ પર નિર્ભર હતી, તેઓ હવે આ સમુદાય-સંચાલિત વિકલ્પ સાથે તે ફીડ્સને વધારી શકે છે અથવા બદલી શકે છે.
આ પ્રોજેક્ટનો "bus factor"—એટલે કે કેટલા લોકોના ગયા પછી પ્રોજેક્ટ ખોરવાઈ શકે છે—તે હાલમાં એક છે. જો મેન્ટેનર અપડેટ્સ સાઇન કરવાનું બંધ કરી દેશે, તો ફીડ સ્થિર થઈ જશે, જેનાથી ડાઉનસ્ટ્રીમ યુઝર્સ પાસે નવા સિગ્નેચર્સ નહીં હોય. લેખક સ્પષ્ટપણે રિપોઝિટરીને સહ-નિર્વાહ (co-maintain) કરવા માટે વધારાના એન્જિનિયરોની માંગ કરી રહ્યા છે, જેથી આ એકલ પ્રયાસને ટકાઉ સમુદાય સંપત્તિમાં ફેરવી શકાય.
Takeaway: LLM પ્રોમ્પ્ટ ઇન્જેક્શન માટે હવે જાહેરમાં વેરિફાઇ કરી શકાય તેવું, સમુદાય-સંચાલિત થ્રેટ-ઇન્ટેલ ફીડ ઉપલબ્ધ છે, જે પ્રોપ્રાઇટરી સોલ્યુશન્સ માટે ઓછા ખર્ચાળ અને પારદર્શક વિકલ્પ તરીકે કામ કરે છે—જો કે શરત એ છે કે સમુદાય તેને જીવંત અને સુસંગત રાખવા માટે આગળ આવે.
