ਓਪਨ-ਸੋਰਸ ਕਮਿਊਨਿਟੀ ਕੋਲ ਹੁਣ ਲਾਰਜ ਲੈਂਗੂਏਜ ਮਾਡਲਾਂ (LLMs) ਨੂੰ ਪ੍ਰੋਂਪਟ-ਇੰਜੈਕਸ਼ਨ (prompt-injection) ਹਮਲਿਆਂ ਤੋਂ ਬਚਾਉਣ ਲਈ ਆਪਣਾ ਪਹਿਲਾ ਫੈਡਰੇਟਿਡ ਥ੍ਰੈਟ-ਇੰਟੈਲ ਫੀਡ (federated threat-intel feed) ਹੈ। prompt-shield v0.6.0 ਦੇ ਨਾਲ ਜਾਰੀ ਕੀਤੀ ਗਈ ਇਹ ਫੀਡ 56 ਚੁਣੇ ਹੋਏ ਅਟੈਕ ਸਿਗਨੇਚਰ (attack signatures) ਪ੍ਰਦਾਨ ਕਰਦੀ ਹੈ, ਜਿਨ੍ਹਾਂ ਵਿੱਚੋਂ ਹਰ ਇੱਕ ed25519 ਕੀ (key) ਨਾਲ ਸਾਈਨ ਕੀਤੀ ਗਈ ਹੈ, ਅਤੇ ਇਸਨੂੰ ਇੱਕ ਹਲਕੇ Python ਕਲਾਇੰਟ ਰਾਹੀਂ ਮੁਫ਼ਤ CDN ਤੋਂ ਪ੍ਰਾਪਤ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ।

LLM ਰੱਖਿਆ ਪ੍ਰਣਾਲੀਆਂ ਵਿੱਚ ਸਾਂਝੇ ਇੰਟੈਲ ਸਰੋਤ ਦੀ ਘਾਟ ਕਿਉਂ ਰਹੀ ਹੈ

ਰਵਾਇਤੀ ਸੁਰੱਖਿਆ ਲੇਅਰਾਂ ਜਨਤਕ ਅਤੇ ਨਿਯਮਤ ਤੌਰ 'ਤੇ ਅਪਡੇਟ ਕੀਤੇ ਜਾਣ ਵਾਲੇ ਸਿਗਨੇਚਰਾਂ 'ਤੇ ਨਿਰਭਰ ਕਰਦੀਆਂ ਹਨ। Web-application firewalls OWASP ਪੈਟਰਨਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ; ਐਂਟੀਵਾਇਰਸ ਪ੍ਰੋਗਰਾਮ ClamAV ਅਪਡੇਟਸ ਨੂੰ ਅਪਣਾਉਂਦੇ ਹਨ। ਉਹ ਫੀਡਸ ਰੱਖਿਆ ਪ੍ਰਣਾਲੀਆਂ ਨੂੰ ਅੱਪ-ਟੂ-ਡੇਟ ਰੱਖਦੀਆਂ ਹਨ। ਇਸਦੇ ਉਲਟ, LLM ਸੁਰੱਖਿਆ ਟੂਲ ਅਲੱਗ-ਥਲੱਗ ਕੰਮ ਕਰਦੇ ਹਨ, ਜਿੱਥੇ ਹਰ ਵੈਂਡਰ ਜਾਂ ਖੋਜਕਰਤਾ ਮਾਲੀਸ਼ੀ ਪ੍ਰੋਂਪਟਸ (malicious prompts) ਦੀ ਇੱਕ ਨਿੱਜੀ ਸੂਚੀ ਰੱਖਦਾ ਹੈ।

ਇਹ ਪਾੜਾ ਤਕਨੀਕੀ ਨਹੀਂ ਹੈ। ਵਪਾਰਕ ਵੈਂਡਰ ਥ੍ਰੈਟ ਡੇਟਾ ਨੂੰ ਇੱਕ ਉਤਪਾਦ ਵਜੋਂ ਮੰਨਦੇ ਹਨ, ਇਸ ਲਈ ਉਹ ਇਸਨੂੰ ਬੰਦ ਰੱਖਦੇ ਹਨ। ਵੱਡੇ ਖੋਜ ਸਮੂਹਾਂ ਕੋਲ ਉਹ "ਬੋਰਿੰਗ" ਇਨਫਰਾਸਟ੍ਰਕਚਰ ਚਲਾਉਣ ਲਈ ਸਮਰੱਥਾ ਨਹੀਂ ਹੁੰਦੀ ਜਿਸਦੀ ਇੱਕ ਜਨਤਕ ਫੀਡ ਨੂੰ ਲੋੜ ਹੁੰਦੀ ਹੈ। ਮੌਜੂਦਾ ਵੈਲੀਡੇਟਰ ਮਾਰਕੀਟਪਲੇਸ ਇੱਕ-ਤਰਫਾ ਹੱਬ ਵਜੋਂ ਕੰਮ ਕਰਦੇ ਹਨ, ਜੋ ਅਸਲ ਸਮੇਂ (real-time) ਦੇ ਕਮਿਊਨਿਟੀ-ਡਰਾਈਵਨ ਸਟ੍ਰੀਮ ਦੀ ਬਜਾਏ ਸਟੈਟਿਕ ਅਪਡੇਟਸ ਭੇਜਦੇ ਹਨ। ਨਤੀਜਾ: ਇੱਕ ਟੁੱਟਿਆ ਹੋਇਆ ਰੱਖਿਆ ਸਤਹ (fragmented defense surface) ਜਿੱਥੇ ਪ੍ਰੋਂਪਟ-ਇੰਜੈਕਸ਼ਨ ਦੀਆਂ ਨਵੀਆਂ ਤਕਨੀਕਾਂ ਬਿਨਾਂ ਨੋਟਿਸ ਕੀਤੇ ਅੰਦਰ ਆ ਜਾਂਦੀਆਂ ਹਨ।

ਨਵੀਂ ਫੀਡ ਕਿਵੇਂ ਕੰਮ ਕਰਦੀ ਹੈ

ਇਹ ਪ੍ਰੋਜੈਕਟ ਇੱਕ ਜਨਤਕ GitHub ਰਿਪੋਜ਼ਟਰੀ 'ਤੇ ਹੈ ਅਤੇ ਇਸ ਵਿੱਚ ਤਿੰਨ ਫਾਈਲਾਂ ਸ਼ਾਮਲ ਹਨ:

  • signatures.json – 56 ਅਟੈਕ ਸਿਗਨੇਚਰ, ਜਿਨ੍ਹਾਂ ਵਿੱਚੋਂ ਹਰ ਇੱਕ ਅਜਿਹੇ ਪੈਟਰਨ ਦਾ ਵਰਣਨ ਕਰਦਾ ਹੈ ਜੋ LLM ਦੇ ਆਉਟਪੁੱਟ ਨੂੰ ਹਾਈਜੈਕ ਕਰ ਸਕਦਾ ਹੈ।
  • signatures.json.minisig – ਇੱਕ ed25519 ਸਿਗਨੇਚਰ ਜੋ JSON ਫਾਈਲ ਨੂੰ ਮੇਨਟੇਨਰ ਦੀ ਪ੍ਰਾਈਵੇਟ ਕੀ ਨਾਲ ਜੋੜਦਾ ਹੈ।
  • public.key – ਉਹ ਪਬਲਿਕ ਕੀ ਜਿਸਦੀ ਵਰਤੋਂ ਕਲਾਇੰਟ ਲਾਇਬ੍ਰੇਰੀਆਂ ਸਿਗਨੇਚਰ ਦੀ ਪੁਸ਼ਟੀ ਕਰਨ ਲਈ ਕਰਦੀਆਂ ਹਨ।

ਇੱਕ 200-ਲਾਈਨਾਂ ਵਾਲਾ pure-Python ਕਲਾਇੰਟ JSON ਨੂੰ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ, ਪਬਲਿਕ ਕੀ ਦੇ ਵਿਰੁੱਧ minisig ਦੀ ਜਾਂਚ ਕਰਦਾ ਹੈ, ਅਤੇ ਕਿਸੇ ਵੀ ਨਵੇਂ ਨਿਯਮ ਨੂੰ prompt-shield ਇੰਜਣ ਵਿੱਚ ਮਿਲਾ ਦਿੰਦਾ ਹੈ। ਜੇਕਰ ਪੁਸ਼ਟੀ (verification) ਅਸਫਲ ਰਹਿੰਦੀ ਹੈ, ਤਾਂ ਕਲਾਇੰਟ ਪਿਛਲੇ ਜਾਣੇ-ਪਛਾਣੇ ਸਹੀ ਕੈਸ਼ (cache) ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ, ਤਾਂ ਜੋ ਅਣਭਰੋਸੇਯੋਗ ਡੇਟਾ ਕਦੇ ਵੀ ਰੱਖਿਆ ਲੇਅਰ ਤੱਕ ਨਾ ਪਹੁੰਚੇ।

ਤਿੰਨ ਡਿਜ਼ਾਈਨ ਸਤੰਭ ਇਸ ਫੀਡ ਨੂੰ ਵੱਖਰਾ ਬਣਾਉਂਦੇ ਹਨ:

  1. Zero telemetry – ਕਲਾਇੰਟ ਸਿਰਫ਼ ਇੱਕ HTTP GET ਰਿਕਵੈਸਟ ਕਰਦਾ ਹੈ; ਇਹ ਕਦੇ ਵੀ ਆਈਡੈਂਟੀਫਾਇਰ, API keys, ਜਾਂ ਵਰਤੋਂ ਦੇ ਮੈਟ੍ਰਿਕਸ ਨਹੀਂ ਭੇਜਦਾ।
  2. Cryptographic verification – ਕੋਈ ਵੀ ਫੀਡ ਡਾਊਨਲੋਡ ਕਰ ਸਕਦਾ ਹੈ, ਪਰ ਸਿਰਫ਼ ਮੇਨਟੇਨਰ ਦੀ ਪ੍ਰਾਈਵੇਟ ਕੀ ਨਾਲ ਸਾਈਨ ਕੀਤੇ ਡੇਟਾ ਨੂੰ ਹੀ ਸਵੀਕਾਰ ਕੀਤਾ ਜਾਂਦਾ ਹੈ।
  3. Fail-safe behavior – ਇੱਕ ਖਰਾਬ ਸਿਗਨੇਚਰ ਸ਼ੀਲਡ ਨੂੰ ਅਯੋਗ ਨਹੀਂ ਕਰਦਾ; ਸਿਸਟਮ ਸਿਰਫ਼ ਪਹਿਲਾਂ ਤੋਂ ਪੁਸ਼ਟੀ ਕੀਤੇ ਨਿਯਮਾਂ ਦੀ ਵਰਤੋਂ ਕਰਨਾ ਜਾਰੀ ਰੱਖਦਾ ਹੈ।

ਸਿਗਨੇਚਰ ਕਈ ਭਰੋਸੇਯੋਗ ਸਰੋਤਾਂ ਤੋਂ ਲਏ ਗਏ ਹਨ: NVIDIA ਦਾ Garak red-team corpus, OWASP LLM Top 10 ਉਦਾਹਰਣਾਂ, HackerOne 'ਤੇ ਜਨਤਕ ਖੁਲਾਸੇ, ਅਤੇ ਮੇਨਟੇਨਰ ਦੁਆਰਾ ਜਾਂਚੇ ਗਏ ਕਮਿਊਨਿਟੀ ਸਬਮਿਸ਼ਨ।

ਕਿਸ ਨੂੰ ਲਾਭ ਹੋਵੇਗਾ ਅਤੇ ਕੀ ਦਾਅਅਵਾਂ ਹੈ

LLM-ਪਾਵਰਡ ਐਪਸ ਬਣਾਉਣ ਵਾਲੇ ਡਿਵੈਲਪਰਾਂ ਕੋਲ ਹੁਣ ਪ੍ਰੋਂਪਟ-ਇੰਜੈਕਸ਼ਨ ਪੈਟਰਨਾਂ ਦਾ ਇੱਕ ਮੁਫ਼ਤ, ਪ੍ਰਮਾਣਿਤ ਸਰੋਤ ਹੈ ਜੋ ਇੱਕ ਸਿੰਗਲ ਕਮਾਂਡ (pip install prompt-shield-ai) ਨਾਲ ਇੰਟੀਗ੍ਰੇਟ ਹੁੰਦਾ ਹੈ। ਉਹ ਸੰਸਥਾਵਾਂ ਜੋ ਕਦੇ ਪ੍ਰੋਪਰਾਈਟਰੀ, closed-source ਇੰਟੈਲ 'ਤੇ ਨਿਰਭਰ ਸਨ, ਉਹ ਉਨ੍ਹਾਂ ਫੀਡਸ ਨੂੰ ਕਮਿਊਨਿਟੀ ਦੁਆਰਾ ਰੱਖ-ਰਖਾਅ ਕੀਤੀ ਬਦਲਵਾਂ ਨਾਲ ਵਧਾ ਸਕਦੀਆਂ ਹਨ ਜਾਂ ਬਦਲ ਸਕਦੀਆਂ ਹਨ।

ਪ੍ਰੋਜੈਕਟ ਦਾ "bus factor"—ਉਹਨਾਂ ਲੋਕਾਂ ਦੀ ਗਿਣਤੀ ਜਿਨ੍ਹਾਂ ਦੇ ਜਾਣ ਨਾਲ ਇਹ ਪ੍ਰੋਜੈਕਟ ਬਰਬਾਦ ਹੋ ਸਕਦਾ ਹੈ—ਮੌਜੂਦਾ ਸਮੇਂ ਵਿੱਚ ਇੱਕ ਹੈ। ਜੇਕਰ ਮੇਨਟੇਨਰ ਅਪਡੇਟਸ 'ਤੇ ਸਾਈਨ ਕਰਨਾ ਬੰਦ ਕਰ ਦਿੰਦਾ ਹੈ, ਤਾਂ ਫੀਡ ਰੁਕ ਜਾਵੇਗੀ, ਜਿਸ ਨਾਲ ਡਾਊਨਸਟ੍ਰੀਮ ਉਪਭੋਗਤਾਵਾਂ ਕੋਲ ਤਾਜ਼ਾ ਸਿਗਨੇਚਰ ਨਹੀਂ ਰਹਿਣਗੇ। ਲੇਖਕ ਨੇ ਰਿਪੋਜ਼ਟਰੀ ਨੂੰ ਸਹਿ-ਰੱਖ-ਰਖਾਅ (co-maintain) ਕਰਨ ਲਈ ਵਾਧੂ ਇੰਜੀਨੀਅਰਾਂ ਦੀ ਸਪੱਸ਼ਟ ਰੂਪ ਵਿੱਚ ਮੰਗ ਕੀਤੀ ਹੈ, ਤਾਂ ਜੋ ਇੱਕ ਇਕੱਲੇ ਦੇ ਯਤਨ ਨੂੰ ਇੱਕ ਟਿਕਾਊ ਕਮਿਊਨਿਟੀ ਸੰਪਤੀ ਵਿੱਚ ਬਦਲਿਆ ਜਾ ਸਕੇ।

Takeaway: LLM ਪ੍ਰੋਂਪਟ ਇੰਜੈਕਸ਼ਨ ਲਈ ਇੱਕ ਜਨਤਕ ਤੌਰ 'ਤੇ ਪ੍ਰਮਾਣਿਤ, ਕਮਿਊਨਿਟੀ-ਡਰਾਈਵਨ ਥ੍ਰੈਟ-ਇੰਟੈਲ ਫੀਡ ਹੁਣ ਉਪਲਬਧ ਹੈ, ਜੋ ਕਿ ਪ੍ਰੋਪਰਾਈਟਰੀ ਹੱਲਾਂ ਦਾ ਇੱਕ ਘੱਟ ਲਾਗਤ ਵਾਲਾ, ਪਾਰਦਰਸ਼ੀ ਵਿਕਲਪ ਪੇਸ਼ ਕਰਦੀ ਹੈ—ਬਸ਼ਰਤੇ ਕਮਿਊਨਿਟੀ ਇਸਨੂੰ ਜਿਉਂਦਾ ਅਤੇ ਪ੍ਰਸੰਗਿਕ ਰੱਖਣ ਲਈ ਅੱਗੇ ਆਵੇ।