OpenAI bugün, otomatik bir red-team hacker'ı olarak hareket eden büyük bir dil modeli olan GPT-Red'i piyasaya sürdü. Sistem, şirketin en yeni GPT-5.6 modelini şimdiden güçlendirerek simüle edilmiş saldırıların başarı oranını %90'ın üzerinden %23'ün altına düşürüyor.

GPT-Red red-team çalışmalarını nasıl otomatikleştiriyor

Bir sistemi kasten kırmaya veya ele geçirmeye çalışmak anlamına gelen red-team testleri, geleneksel olarak güvenlik uzmanlarına dayanıyordu. LLM'ler web'de gezinmeyi, kod çalıştırmayı ve üçüncü taraf hizmetleri çağırmayı öğrendikçe, kötüye kullanılabilecekleri yöntemler bir insan ekibinin keşfedebileceğinden daha hızlı bir şekilde çoğalıyor.

OpenAI, araştırmacıların "dojo" olarak adlandırdığı simüle edilmiş bir ortamda bir model kopyasını diğeriyle karşı karşıya getiren bir “self-play loop” (kendi kendine oynama döngüsü) ile buna yanıt verdi. Bu sandbox (kum havuzu) ortamında GPT-Red saldırgan rolünü üstlenirken, bir veya daha fazla savunmacı model direnç göstermeye çalışıyor. İki taraf sayısız tur gerçekleştiriyor; her yineleme, saldırganı daha ince kusurları ortaya çıkarmaya, savunmacıyı ise yeni savunmalar öğrenmeye zorluyor. OpenAI bu süreci, şirketin şimdiye kadarki en sağlam sürümü olarak öne çıkardığı GPT-5.6'yı üreten eğitim hattına (training pipeline) entegre etti.

Yeni bir saldırı sınıfı: sahte düşünce zinciri

Self-play çalışmaları çarpıcı bir “sahte düşünce zinciri” (fake chain of thought) saldırısını ortaya çıkardı. LLM'ler genellikle nihai cevaba rehberlik eden adım adım bir akıl yürütme izi —bir “düşünce zinciri”— sunarlar. GPT-Red, bu iz içine sahte girişler yerleştirmeyi öğrenerek modelin yanlış önermeleri zaten doğrulamış olduğunu sanmasını sağlıyor. Örneğin saldırgan, modele “1 + 1 = 3” ifadesinin kontrol edildiğine ikna edebilir ve böylece sistemi uydurma sonuçlara dayalı çıktılar üretmeye yönlendirebilir.

Saldırı sadece saf metin oluşturucularla sınırlı değil. Harici bir laboratuvar tarafından oluşturulan otomat tarzı bir ajan olan “Vendy”ye karşı yapılan bir testte GPT-Red, fiyat alanlarını manipüle etti ve siparişleri iptal etti; bu da tekniğin kullanıcı komutlarına göre hareket eden özelleşmiş ajanlara karşı işe yaradığını kanıtladı.

Ölçülebilir güvenlik artışı

OpenAI, GPT-Red'e karşı eğitimin etkisini gösteren rakamlar yayınladı. Yeni model tarafından üretilen en güçlü saldırılar Ağustos ayında yayınlanan GPT-5'e karşı çalıştırıldığında %90'dan fazlası başarılı oldu. Aynı saldırılar GPT-5.6'ya karşı uygulandığında ise başarı oranı %23'ün altında kaldı.

GPT-Red'i insan red-team uzmanlarıyla karşı karşıya getiren 2025 yılındaki bir deneyde, yapay zeka saldırı varyasyonlarını insanlardan daha verimli bir şekilde keşfetti ve geliştirdi; bu da saldırgan bir modelin (adversarial model) zafiyet alanının daha geniş bir kısmını daha kısa sürede keşfedebileceğini gösteriyor.

Sınırlar ve insan uzmanlığına devam eden ihtiyaç

GPT-Red, insan güvenlik analistlerinin yerini almaz. Saldırganın birkaç karşılıklı konuşma üzerinden bir anlatı oluşturduğu çok turlu diyalog saldırılarında ve kötü niyetli metinleri görsellerin içine gizleyen görsel istem enjeksiyonlarında (visual prompt injections) hala takılıyor. OpenAI, modeli ilk hat probu olarak kullanmayı, insan uzmanların incelemesi ve geliştirmesi için gelecek vaat eden saldırı fikirlerini ortaya çıkarmayı planlıyor.

Araç mülkiyeti şirkete ait (proprietary) kalmaya devam ediyor, bu nedenle dış araştırmacılar yeteneklerini doğrudan test edemiyor veya bildirilen kazanımları doğrulayamıyor.