Açık kaynak topluluğu, büyük dil modellerini (LLM'ler) prompt-injection saldırılarına karşı savunmak için ilk federatif tehdit istihbaratı akışına (feed) sahip oldu. prompt-shield v0.6.0 ile yayınlanan bu akış, her biri bir ed25519 anahtarıyla imzalanmış 56 küratörlü saldırı imzası sunuyor ve hafif bir Python istemcisi aracılığıyla ücretsiz bir CDN'den çekilebiliyor.

LLM savunmalarının neden ortak bir istihbarat kaynağından yoksun olduğu

Geleneksel güvenlik katmanları, herkese açık ve düzenli olarak güncellenen imzalara dayanır. Web uygulama güvenlik duvarları OWASP desenlerini kullanır; antivirüs programları ClamAV güncellemelerini bünyesine katar. Bu akışlar savunmaları güncel tutar. Buna karşılık, LLM güvenlik araçları izole bir şekilde çalışır; her satıcı veya araştırmacı kendi özel kötü amaçlı istem listesini tutar.

Aradaki boşluk teknik değil. Ticari satıcılar tehdit verilerini bir ürün olarak gördüklerinden bunları kapalı tutuyorlar. Büyük araştırma grupları ise halka açık bir akışın gerektirdiği "sıkıcı" altyapıyı çalıştıracak bant genişliğine sahip değil. Mevcut doğrulayıcı pazaryerleri, gerçek zamanlı ve topluluk odaklı bir akış yerine statik güncellemeler sunan tek yönlü merkezler olarak işlev görüyor. Sonuç: yeni prompt-injection tekniklerinin fark edilmeden sızabildiği parçalı bir savunma yüzeyi.

Yeni akış nasıl çalışıyor

Proje, halka açık bir GitHub deposunda yer alıyor ve üç dosya içeriyor:

  • signatures.json – Her biri bir LLM'in çıktısını ele geçirebilecek bir deseni tanımlayan 56 saldırı imzası.
  • signatures.json.minisig – JSON dosyasını sürdürücünün (maintainer) özel anahtarına bağlayan bir ed25519 imzası.
  • public.key – İstemci kütüphanelerinin imzayı doğrulamak için kullandığı genel anahtar.

200 satırlık saf Python (pure-Python) istemcisi JSON'u çeker, minisig'i genel anahtara karşı kontrol eder ve yeni kuralları prompt-shield motoruna dahil eder. Doğrulama başarısız olursa, istemci son bilinen güvenli önbelleğe (cache) geri döner; böylece güvenilmeyen veriler savunma katmanına asla ulaşmaz.

Üç tasarım sütunu bu akışı farklı kılıyor:

  1. Sıfır telemetri – istemci tek bir HTTP GET isteği yapar; asla tanımlayıcılar, API anahtarları veya kullanım metrikleri göndermez.
  2. Kriptografik doğrulama – herkes akışı indirebilir, ancak yalnızca sürdürücünün özel anahtarıyla imzalanmış veriler kabul edilir.
  3. Hata korumalı (fail-safe) davranış – bozuk bir imza kalkanı devre dışı bırakmaz; sistem sadece daha önce doğrulanmış kuralları kullanmaya devam eder.

İmzalar birkaç saygın kaynaktan besleniyor: NVIDIA'nın Garak red-team külliyatı, OWASP LLM Top 10 örnekleri, HackerOne üzerindeki halka açık açıklamalar ve sürdürücü tarafından incelenmiş topluluk gönderileri.

Kimler yararlanıyor ve riskler neler

LLM destekli uygulamalar geliştiren yazılımcılar, artık tek bir komutla (pip install prompt-shield-ai) entegre edilebilen, ücretsiz ve doğrulanabilir bir prompt-injection desenleri kaynağına sahip. Eskiden tescilli ve kapalı kaynaklı istihbarata güvenen kuruluşlar, bu akışları topluluk tarafından sürdürülen bir alternatifle güçlendirebilir veya değiştirebilir.

Projenin "otobüs faktörü" (bus factor) —yani kaybı projeyi felç edecek kişi sayısı— şu anda bir. Eğer sürdürücü güncellemeleri imzalamayı bırakırsa, akış duraklayacak ve alt kullanıcılar yeni imzalardan mahrum kalacaktır. Yazar, depoyu birlikte sürdürmeleri için açıkça ek mühendisler talep ederek, tek kişilik bir çabayı sürdürülebilir bir topluluk varlığına dönüştürmeyi amaçlıyor.

Özet: LLM prompt injection için halka açık olarak doğrulanabilir, topluluk odaklı bir tehdit istihbaratı akışı artık mevcut; topluluk onu canlı ve güncel tutmak için sorumluluk aldığı sürece, tescilli çözümlere düşük maliyetli ve şeffaf bir alternatif sunuyor.