LLM Guard deposu 9 Temmuz 2026 tarihinde arşiv moduna alındı ve tüm kod ile model güncellemeleri sona erdi.
Bu değişikliğin önemi
LLM Guard, geliştiricilerin yönetilen bir hizmet için ödeme yapmadan, bir büyük dil modelinin (LLM) önüne veya arkasına yerleştirilen kontroller olan "raylar" (rails) eklemelerine olanak tanıyan, topluluk tarafından sürdürülen az sayıdaki ücretsiz araç kitinden biriydi. Projenin dondurulmasıyla birlikte bu güvenlik önlemleri ortadan kalkıyor. Aynı zamanda, daha geniş yapay zeka güvenliği pazarı konsolide oluyor: Protect AI, Palo Alto Networks tarafından; Lakera, Check Point tarafından absorbe edildi ve OpenAI, promptfoo'yu satın aldı. Pazar, bağımsız projelerden oluşan bir yamalı bohçadan birkaç platform düzeyindeki teklife doğru kayıyor ve geliştiriciler bir sonraki savunma hatlarını nereye kuracaklarına karar vermek zorunda kalıyorlar.
Çözülmesi gereken üç koruma rayı (guardrail) problemi
- Giriş rayları (Input rails) – kullanıcının istemini (prompt) modele ulaşmadan önce inceleyen, enjeksiyon girişimlerini ve jailbreak tekniklerini engelleyen filtreler.
- Çıkış rayları (Output rails) – modelin yanıtını değerlendiren; toksik dili, telif hakkı içeren materyalleri veya özel verilerin kazara ifşa edilmesini engelleyen tarayıcılar.
- Red-team testi – modelin ve koruyucularının bilinen saldırı kalıplarına karşı dayanıklılığını doğrulamak için geliştirme sırasında (genellikle CI/CD süreçlerinde) çalıştırılan bir saldırgan test paketidir. Bu adım, zayıf noktaları üretim aşamasına geçmeden önce ortaya çıkarır; bir çalışma zamanı (runtime) filtresi değildir.
Red-team testini canlı bir engelleme mekanizması gibi değerlendirmek, yanlış bir güvenlik algısı yaratabilir.
Hala kullanımda olan açık kaynaklı alternatifler
| Araç | Lisans | En uygun kullanım alanı |
|---|---|---|
| NeMo Guardrails | Apache 2.0 | Karmaşık çok turlu diyaloglar ve retrieval-augmented generation; koruma rayı mantığını tanımlamak için alana özgü Colang dilini kullanır. |
| Guardrails AI | Apache 2.0 | Kademeli doğrulama – küfür veya izin verilmeyen konular gibi belirli bir risk için her seferinde bir kural ekleyin. |
| Presidio | MIT | Kişisel olarak tanımlanabilir bilgilerin (PII) çevrimdışı tespiti ve maskelenmesi; şu an topluluk mülkiyetindedir, ancak gürültülü yanlış pozitiflerden kaçınmak için varlık listesini kendiniz tanımlamalısınız. |
| Llama Prompt Guard 2 | Prompt enjeksiyonlarını ve jailbreak girişimlerini tespit etmeye odaklanan, kendi sunucunuzda barındırabileceğiniz bir sınıflandırıcı. | |
| promptfoo | MIT | CI süreçleriyle entegre olan red-team çerçevesi; modelinize karşı yüzlerce saldırı vektörü çalıştırabilir ve başarılı olanları raporlayabilir. |
Bu projeler hala topluluk katkıları almaktadır ve kaynak kodları, kendi sunucunuzda barındırmak veya özel süreçlere dahil etmek için ücretsiz olarak mevcuttur.
Göz atmaya değer yönetilen koruma rayları
Eğer anahtar teslim bir çözüm tercih ediyorsanız, iki büyük bulut sağlayıcısı artık koruma raylarını LLM tekliflerine dahil ediyor:
- Amazon Bedrock Guardrails – İstek başına açılıp kapatılabilen yapılandırılabilir politikalar.
- Azure Prompt Shields – Azure OpenAI Service ile entegre edilmiş benzer çalışma zamanı filtreleri.
Her ikisi de istek başına ücret alır; bir milyon çağrı hızla birkaç yüz dolara ulaşabilir. Bütçe odaklı ekipler, bunları ölçekli bir şekilde etkinleştirmeden önce beklenen trafiği modellemelidir.
Güvenlik yığınınızı nasıl yeniden inşa edersiniz
- “Ölümcül üçlüyü” haritalandırın. Uygulamanızın (a) özel veri depolarına, (b) güvenilmeyen kullanıcı girdilerine ve (c) harici ağ çağrılarına temas ettiği noktaları belirleyin. Bunlardan herhangi birini ortadan kaldırmak, saldırı yüzeyini tek bir koruma rayının yapabileceğinden çok daha fazla azaltır.
- Presidio'yu erkenden devreye alın. Modele beslemeyi planladığınız tüm veriler üzerinde çalıştırın. Varlık listesini özelleştirin; varsayılan set, birçok zararsız dizgiyi PII olarak işaretler, bu da sonraki süreçleri bozabilir.
- Bir giriş rayı ekleyin. Llama Prompt Guard 2 gibi hafif bir sınıflandırıcı veya Guardrails AI'dan kural tabanlı bir koruyucu ile başlayın. Bariz enjeksiyon kalıplarını modele ulaşmadan engelleyin.
- Çıkış kontrollerini katmanlandırın. NeMo Guardrails veya Guardrails AI, modelin yanıtını sonradan işleyerek aradan sızan toksik dili veya gizli bilgi parçacıklarını temizleyebilir.
- promptfoo'yu CI süreçlerine entegre edin. Raporlarını bir kontrol listesi olarak değerlendirin; yeni keşfedilen her atlatma yöntemi, giriş veya çıkış rayınızda bir kural olarak kodlanmalıdır.
- Her engellemeyi günlüğe kaydedin. Orijinal isteği, reddedilme nedenini ve alınan işlemi saklayın. Günlükler olmadan eşik değerlerini ayarlayamaz veya uyumluluğu denetleyemezsiniz.
Karşı görüş: yönetilen hizmetler vs. açık kaynak
Yönetilen guardrail'lar; self-hosting, yamalama ve sınıflandırıcıları ölçeklendirme gibi operasyonel yüklerden sizi kurtarır. Ancak, sizi bir sağlayıcının fiyatlandırma ve politika modeline bağımlı kılar; bu da niş düzenleyici gereksinimlerle eşleşmeyebilir. Açık kaynaklı araçlar size tam kontrol sağlar ve yerinde (on-premise) çalışabilir, ancak güncel tutulmaları ve yeni saldırı tekniklerinin izlenmesi için mühendislik çabası gerektirirler. Ekipler, personel zaman maliyetini bir bulut guardrail'ının istek başına ücretleriyle kıyaslamalıdır.
Bundan sonra nelere dikkat edilmeli
- Satıcı yol haritaları. Palo Alto ve Check Point'in yapay zeka güvenliği ürün duyurularını takip edin; satın alınan araçların yeteneklerini daha geniş paketlere dahil etmeleri muhtemeldir.
- Topluluk aktivitesi. NeMo Guardrails ve Presidio gibi projelerin sağlığını, son pull-request aktivitelerine ve sürüm sıklığına bakarak değerlendirin. Durgun bir repo, yeni bir alternatifin ortaya çıktığının sinyali olabilir.
- Düzenleyici rehberlik. Hükümetler yapay zeka tarafından üretilen içerik ve veri koruması üzerindeki kuralları sıkılaştırdıkça, her türlü guardrail stratejisi denetlenebilir olmalıdır. Birçok yargı alanında günlükleme (logging) ve izlenebilirlik zorunlu hale gelecektir.
Temel Çıkarım
LLM Guard'ın resmi olarak emekli edilmesiyle birlikte, geliştiriciler LLM destekli uygulamalarını güvende tutmak için girdi filtreleri, çıktı temizleyicileri (sanitizers) ve adversarial testlerin bir karışımını bir araya getirmelidir. NeMo Guardrails, Guardrails AI, Presidio, Llama Prompt Guard 2 ve promptfoo gibi açık kaynaklı projeler yapı taşlarını sağlarken, bulut tabanlı (cloud-native) guardrail'lar bir bedel karşılığında kolaylık sunar. Belirleyici faktör hangi aracı seçtiğiniz değil, gelişen tehdit ortamının önünde kalabilen sistematik bir süreç —denetle, koru, test et ve kaydet— oluşturup oluşturmadığınızdır.
