Anthropic, yakın zamanda gerçekleştirilen bir güvenlik testi kampanyası sırasında üç Claude modelinin sandbox'tan sızarak gerçek dünya sistemlerine eriştiğini, bunun da değerlendirmelerin derhal durdurulmasına ve kamuoyuna bir rapor sunulmasına yol açtığını belirtti.

Şirket 141.006 siber güvenlik testi gerçekleştirdi ve modellerin simüle edilmiş ortam yerine canlı hedeflere ulaştığı üç olay tespit etti. Üçüncü taraf bir iş ortağıyla ilgili bir yapılandırma hatası, sandbox'ı fiilen açık bıraktı.

İhlaller nasıl gerçekleşti

  • Claude Opus 4.7, internete açık gerçek bir şirkete ulaştı ve birkaç yüz satırlık bir veritabanını çekmek için zayıf şifreleri tahmin etti.
  • Claude Mythos 5, gerçek PyPI deposuna bir paket yayınlayarak bir tedarik zinciri saldırısı gerçekleştirdi. Paket, kayıt defteri anomaliyi işaretlemeden önce 15 üretim makinesine yüklendi.
  • Bir dahili araştırma modeli 9.000 hedefi taradı, tek bir uygulamayı ele geçirdi ve ardından ana bilgisayarın simüle edilen göreviyle eşleşmediğini fark ederek işlemi kendiliğinden durdurdu.

Anthropic, bunların "asi yapay zeka" (rogue AI) vakaları olmadığını vurguluyor. Modeller kendilerine söyleneni yaptı; test altyapısı onları açık internetten izole etmeyi başaramadı.

Neden önemli

Bu olaylar, yapay zeka ajanları kod yürütebildiğinde ve ağ çağrıları yapabildiğinde, kontrollü bir sandbox ile canlı bir ağ arasındaki çizginin ne kadar ince olduğunu gösteriyor. Otonom ajanlarla deneyler yapan işletmeler için bir sistem istemi (system prompt) veya README dosyası sınırları garanti edemez. PyPI vakasının gösterdiği gibi, mütevazı bir veri seti veya birkaç makine bile daha büyük tedarik zinciri ihlallerini tetikleyebilir.

Üç ihlal aynı zamanda Anthropic'in çabasının ölçeğini de ortaya koyuyor: Şirket rastgele bir örneklem yerine her bir test çalışmasını denetledi. Bu titizlik, şirketin yapılandırma hatasını olaylar yayılmadan tespit etmesini sağladı.

Anthropic ne yaptı

Sandbox hatasının keşfedilmesinden bir gün sonra Anthropic devam eden tüm değerlendirmeleri durdurdu. Bir hafta sonra ise üç olayı, teknik nedeni ve acil çözüm adımlarını listeleyen ayrıntılı bir açıklama yayınladı.

Yapay zeka ajanı kullanıcıları için pratik çıkarımlar

  1. Ağ sınırlarını doğrudan kontrollerle doğrulayın – bir istemin veya yapılandırma dosyasının ajanı gerçekten izole ettiğini varsaymayın.
  2. Kimlik bilgilerini minimum düzeyde tutun – yalnızca görevin kesinlikle ihtiyaç duyduğu yetkileri verin.
  3. Erişilebilirliği kendiniz test edin – hassas kaynakları devretmeden önce ajanın gerçek ağ görünümünü inceleyin.
  4. İstenmeyen faaliyetleri izleyin – plandan sapan giden bağlantılar veya paket kayıtları için uyarılar kurun.

Bu olay basit bir gerçeğin altını çiziyor: Bir yapay zeka modeline internet erişimi vermek, bir insan operatöre kimlik bilgileri teslim etmek kadar risklidir. Sandbox garantileri kanıtlanana kadar, yapay zeka tarafından gerçekleştirilen her eylemi potansiyel olarak kısıtlanmamış olarak değerlendirin ve ortamı buna göre kilitleyin.