Anthropic'in kötüye kullanım raporu, kötü niyetli aktörlerin Claude'u spamcılar, aktivistler ve kötü amaçlı yazılım yazarları için bir seri üretim aracına dönüştürdüğünü gösteriyor. Aralık ve Ağustos ayları arasında bir grup; modeli 4.700 sahte arkadaşlık uygulaması kişiliği üzerinden 2 milyon mesaj oluşturmak, kişileri kandırmak için bir aktivistin üslubunu taklit etmek ve gözetleme ile silahlar için kod yazmak amacıyla kullandı.
Rapor neden önemli
Yapay zeka tarafından oluşturulan metinler eskiden sadece meraklıların ilgisini çeken bir uğraştı. Yeni veriler, teknolojinin, bir zamanlar büyük ölçekli suistimali sınırlayan tekrarlayıcı işleri otomatikleştirecek kadar ucuz olduğunu kanıtlıyor. Binlerce kurgusal kimlik oluşturmak ve sürdürmek ya da güvenlik araçları tarafından işaretlenen kötü amaçlı kodları yeniden yazmak eskiden insan ekipleri gerektiriyordu. Claude, bu engelleri birkaç tıklamaya indirgeyerek manuel bir çileyi tekrarlanabilir bir iş akışına dönüştürüyor.
Sorunun boyutu
- Spam: 4.700 kişilik, filtrelenmesi zor 2 milyon kişiselleştirilmiş teklif gönderildi.
- Taklitçilik: Bir aktivistin yazım tarzı kopyalandı ve bu durum saldırganların aktivistin ağına ikna edici talepler göndermesine olanak tanıdı.
- Kötü amaçlı yazılım ve gözetleme: Kullanıcılar, tespiti atlatmak için Claude tarafından oluşturulan betikleri dışa aktardı ve her engellemeden sonra bunları yeniden yayına aldı.
Değişim, münferit kötü mesajlardan sürekli ve büyük ölçekli operasyonlara doğru gerçekleşiyor.
Anthropic'in yanıtı
Anthropic, ihlalde bulunan hesapları engelledi ve tespit edilen faaliyeti durdurdu. Bu durum, söz konusu kullanıcılardan gelen anlık akışı durdurdu ancak halihazırda piyasaya sürülmüş olan kodları veya botları yok etmedi. Bir araç paketlenip dağıtıldıktan sonra, sağlayıcının kontrolü sona erer.
Yapay zeka güvenliği hakkında ne söylüyor?
Rapor, "tehlikeli" taleplerin nasıl ele alındığının yeniden düşünülmesini zorunlu kılıyor. Yasaklı istemlerden oluşan statik bir liste artık işe yaramıyor. Anthropic'in dahili notları şunları talep ediyor:
- Tek seferlik kontroller yerine kullanım modellerinin sürekli izlenmesi.
- Modeli büyük ölçekte kimlerin çalıştırabileceğini sınırlayan daha sıkı erişim kontrolleri.
- Birlikte daha büyük bir tehdit oluşturan, küçük ve görünüşte zararsız görünen istek kümelerini tespit etmek için insan analistler.
Liderler için ikilem
Daha sıkı koruma önlemleri; meşru araştırmaları, hızlı prototiplemeyi ve esnek yapay zeka çıktılarına dayanan müşteri odaklı özellikleri engelleyebilir. Daha gevşek politikalar ise suistimalin kontrolsüz bir şekilde büyümesine izin vererek marka hasarı, düzenleyici inceleme ve gerçek dünyada zarar görme riskini artırır. Karar vericiler, verimlilik artışını potansiyel kötüye kullanımın maliyetiyle tartmalıdır.
Geleceğe bakış
Eğer bu eğilim devam ederse, yapay zeka güvenliği bir laboratuvar meselesi olmaktan çıkıp operasyonel bir mesele haline gelecektir. Şirketlerin, modelin kötüye kullanımını diğer tüm güvenlik olayları gibi ele alan —logları izleyen, kontrolleri güncelleyen ve ihlallere gerçek zamanlı yanıt veren— özel ekiplere ihtiyacı olacak. Claude kötüye kullanım raporu, yardımcı olmak için tasarlanan araçların, büyük ölçekte, aslında yerini alması gereken silahların kendisine dönüşebileceği konusunda uyarıyor.
