പ്രോംപ്റ്റ്-ഇഞ്ചക്ഷൻ (prompt-injection) ആക്രമണങ്ങളിൽ നിന്ന് ലാർജ് ലാംഗ്വേജ് മോഡലുകളെ (LLMs) സംരക്ഷിക്കുന്നതിനായുള്ള ആദ്യത്തെ ഫെഡറേറ്റഡ് ത്രെറ്റ്-ഇൻ്റൽ ഫീഡ് (federated threat-intel feed) ഇപ്പോൾ ഓപ്പൺ സോഴ്സ് കമ്മ്യൂണിറ്റിക്കായി ലഭ്യമാണ്. prompt-shield v0.6.0-നൊപ്പം പുറത്തിറക്കിയ ഈ ഫീഡിൽ, ed25519 കീ ഉപയോഗിച്ച് ഒപ്പിട്ട 56 ക്യൂറേറ്റഡ് അറ്റാക്ക് സിഗ്നേച്ചറുകൾ (attack signatures) അടങ്ങിയിരിക്കുന്നു. ഒരു ലൈറ്റ്വെയ്റ്റ് Python ക്ലയൻ്റിലൂടെ സൗജന്യ CDN-ൽ നിന്ന് ഇത് ലഭ്യമാണ്.

എന്തുകൊണ്ടാണ് LLM പ്രതിരോധ സംവിധാനങ്ങൾക്ക് ഒരു പങ്കിട്ട ഇൻ്റൽ സ്രോതസ്സ് ഇല്ലാതിരുന്നത്

പരമ്പരാഗത സുരക്ഷാ പാളികൾ പൊതുവായതും കൃത്യമായി പുതുക്കപ്പെടുന്നതുമായ സിഗ്നേച്ചറുകളെയാണ് ആശ്രയിക്കുന്നത്. വെബ്-ആപ്ലിക്കേഷൻ ഫയർവാളുകൾ OWASP പാറ്റേണുകൾ ഉപയോഗിക്കുന്നു; ആൻ്റിവൈറസ് പ്രോഗ്രാമുകൾ ClamAV അപ്‌ഡേറ്റുകൾ സ്വീകരിക്കുന്നു. ഈ ഫീഡുകൾ പ്രതിരോധ സംവിധാനങ്ങളെ ആധുനികമായി നിലനിർത്തുന്നു. ഇതിനു വിപരീതമായി, LLM സുരക്ഷാ ടൂളുകൾ ഒറ്റപ്പെട്ട രീതിയിലാണ് പ്രവർത്തിക്കുന്നത്; ഓരോ വെണ്ടറോ ഗവേഷകനോ ദോഷകരമായ പ്രോംപ്റ്റുകളുടെ (malicious prompts) സ്വന്തം പട്ടികയാണ് സൂക്ഷിക്കുന്നത്.

ഈ വിടവ് സാങ്കേതികമായ ഒന്നല്ല. വാണിജ്യ വെണ്ടർമാർ ത്രെറ്റ് ഡാറ്റയെ ഒരു ഉൽപ്പന്നമായി കാണുന്നു, അതിനാൽ അവർ അത് രഹസ്യമായി സൂക്ഷിക്കുന്നു. ഒരു പൊതു ഫീഡിന് ആവശ്യമായ "വിരസമായ" ഇൻഫ്രാസ്ട്രക്ചർ പ്രവർത്തിപ്പിക്കാനുള്ള ശേഷി വലിയ ഗവേഷണ ഗ്രൂപ്പുകൾക്കില്ല. നിലവിലുള്ള വാലിഡേറ്റർ മാർക്കറ്റ് പ്ലേസുകൾ വൺ-വേ ഹബ്ബുകളായി പ്രവർത്തിക്കുന്നു; അവ തത്സമയ കമ്മ്യൂണിറ്റി അധിഷ്ഠിത സ്ട്രീമിന് പകരം സ്റ്റാറ്റിക് അപ്‌ഡേറ്റുകളാണ് നൽകുന്നത്. ഇതിൻ്റെ ഫലം: പുതിയ പ്രോംപ്റ്റ്-ഇഞ്ചക്ഷൻ സാങ്കേതികവിദ്യകൾ ശ്രദ്ധിക്കപ്പെടാതെ കടന്നുപോകുന്ന വിഭജിക്കപ്പെട്ട ഒരു പ്രതിരോധ സംവിധാനം.

പുതിയ ഫീഡ് എങ്ങനെ പ്രവർത്തിക്കുന്നു

ഈ പ്രോജക്റ്റ് ഒരു പബ്ലിക് GitHub റെപ്പോസിറ്ററിയിലാണ് ഉള്ളത്, ഇതിൽ മൂന്ന് ഫയലുകൾ ഉൾപ്പെടുന്നു:

  • signatures.json – ഒരു LLM-ൻ്റെ ഔട്ട്പുട്ട് ഹൈജാക്ക് ചെയ്യാൻ സാധ്യതയുള്ള ഓരോ പാറ്റേണിനെയും വിവരിക്കുന്ന 56 അറ്റാക്ക് സിഗ്നേച്ചറുകൾ.
  • signatures.json.minisig – JSON ഫയലിനെ മെയിൻ്റൈനറുടെ പ്രൈവറ്റ് കീയുമായി ബന്ധിപ്പിക്കുന്ന ഒരു ed25519 സിഗ്നേച്ചർ.
  • public.key – സിഗ്നേച്ചർ പരിശോധിക്കാൻ ക്ലയൻ്റ് ലൈബ്രറികൾ ഉപയോഗിക്കുന്ന പബ്ലിക് കീ.

200 വരികളുള്ള ഒരു പ്യുവർ-Python ക്ലയൻ്റ് JSON ഫയൽ എടുക്കുകയും, പബ്ലിക് കീ ഉപയോഗിച്ച് minisig പരിശോധിക്കുകയും, പുതിയ നിയമങ്ങൾ prompt-shield എഞ്ചിനിലേക്ക് ചേർക്കുകയും ചെയ്യുന്നു. വെരിഫിക്കേഷൻ പരാജയപ്പെട്ടാൽ, ക്ലയൻ്റ് അവസാനമായി ഉപയോഗിച്ച ശരിയായ കാഷെ (cache) ഉപയോഗിക്കുന്നു, അങ്ങനെ വിശ്വസനീയമല്ലാത്ത ഡാറ്റ പ്രതിരോധ പാളികളിൽ എത്തില്ലെന്ന് ഉറപ്പാക്കുന്നു.

ഈ ഫീഡിനെ വ്യത്യസ്തമാക്കുന്ന മൂന്ന് ഡിസൈൻ തൂണുകൾ:

  1. Zero telemetry – ക്ലയൻ്റ് ഒരു സിംഗിൾ HTTP GET റിക്വസ്റ്റ് മാത്രമേ നടത്തുന്നുള്ളൂ; ഇത് ഐഡൻ്റിഫയറുകളോ, API കീകുകളോ, ഉപയോഗ വിവരങ്ങളോ (usage metrics) ഒരിക്കലും അയക്കുന്നില്ല.
  2. Cryptographic verification – ആർക്കും ഫീഡ് ഡൗൺലോഡ് ചെയ്യാം, എന്നാൽ മെയിൻ്റൈനറുടെ പ്രൈവറ്റ് കീ ഉപയോഗിച്ച് ഒപ്പിട്ട ഡാറ്റ മാത്രമേ സ്വീകരിക്കപ്പെടുകയുള്ളൂ.
  3. Fail-safe behavior – ഒരു സിഗ്നേച്ചർ തകരാറിലായാലും അത് ഷീൽഡിനെ പ്രവർത്തനരഹിതമാക്കില്ല; സിസ്റ്റം നേരത്തെ പരിശോധിച്ചുറപ്പീകരിച്ച നിയമങ്ങൾ തന്നെ തുടർന്നും ഉപയോഗിക്കുന്നു.

ഈ സിഗ്നേച്ചറുകൾ പല പ്രശസ്തമായ സ്രോതസ്സുകളിൽ നിന്നാണ് ശേഖരിക്കുന്നത്: NVIDIA-യുടെ Garak red-team corpus, OWASP LLM Top 10 ഉദാഹരണങ്ങൾ, HackerOne-ലെ പബ്ലിക് ഡിസ്‌ക്ലോഷറുകൾ, കൂടാതെ മെയിൻ്റൈനർ പരിശോധിച്ച കമ്മ്യൂണിറ്റി സബ്മിഷനുകൾ എന്നിവ ഇതിൽ ഉൾപ്പെടുന്നു.

ആർക്കൊക്കെ പ്രയോജനം ലഭിക്കും, എന്താണ് ഇതിൻ്റെ പ്രാധാന്യം

LLM അധിഷ്ഠിത ആപ്പുകൾ നിർമ്മിക്കുന്ന ഡെവലപ്പർമാർക്ക് ഇപ്പോൾ ഒരു സിംഗിൾ കമാൻഡ് (pip install prompt-shield-ai) ഉപയോഗിച്ച് സംയോജിപ്പിക്കാവുന്ന, സൗജന്യവും പരിശോധിക്കാവുന്നതുമായ പ്രോംപ്റ്റ്-ഇഞ്ചക്ഷൻ പാറ്റേണ