Araştırmacılar, şifrelenmiş muhakeme izlerinin (reasoning traces)—bir sağlayıcının, bir konuşmanın modeller arasında geçiş yapabilmesi için kullanıcının cihazına gönderdiği küçük paketler—aynı servisteki daha zayıf bir model tarafından çözülebileceğini ve yüzlerce kimlik bilgisi ile özel detayın sızdırılabileceğini gösterdi. Stealing Reasoning Traces from Proprietary LLM APIs başlıklı makalede ayrıntıları sunulan bu bulgu, Anthropic, OpenAI ve Google'ın yapay zeka sohbetlerini akıcı tutmak için güvendiği bir kolaylık özelliğini tehdit ediyor.

Şifrelenmiş bloklar neden mevcut?

Bir büyük dil modeli (LLM) ile konuştuğunuzda, servis bir "muhakeme izi" (reasoning trace) oluşturur: cevaba yol açan dahili istemler (prompts), araç çağrıları ve düşünce zinciri (chain-of-thought) adımlarının dizisi. Bu zinciri kaybetmeden daha büyük bir modelden daha ucuz bir modele geçmenize olanak tanımak için sağlayıcılar izi şifreler, cihazınıza gönderir ve bir sonraki istekte bunu geri göndermenizi bekler. Şifreleme, oturumlar arası ve modeller arası sürekliliği sağlarken izi gizli tutmayı amaçlar.

Saldırı nasıl çalışıyor?

Araştırmacılar, güçlü modelin kendisinde herhangi bir ihlal gerektirmeyen üç adımlı bir istismar yöntemi gösterdiler:

  1. Normal bir konuşma sırasında güçlü bir model tarafından oluşturulan şifrelenmiş bir muhakeme bloğunu yakalayın.
  2. Bu bloğu aynı sağlayıcıdan daha zayıf bir modele verin ve bloktaki içeriği "okumasını" isteyin.
  3. Zayıf model aynı şifre çözme anahtarlarını paylaştığı için, şifresi çözülmüş içeriği düz metin olarak çıktı olarak verir.

Zayıf model bir şifre çözme kahini (decryption oracle) görevi görür. Saldırganlar güçlü modelin dahili yapısına asla dokunmadılar; sadece sağlayıcının kendi API'sini kendisine karşı kullandılar.

Araştırmacıların geri elde ettiği veriler

  • 182 kimlik bilgisi – iz içine gömülmüş API anahtarları, tokenlar ve diğer sırlar.
  • 367 özel bilgi parçası – kullanıcıların sohbet sırasında sağladığı isimler, e-postalar, adresler.
  • Prompt-injection (istem enjeksiyonu) yükleri – şifrelenmiş blokta gizlenen ve iz tekrar oynatıldığında yürütülebilecek kötü niyetli talimatlar.
  • Güvenlik filtresi atlatmaları – şifresi çözülen iz, düz metin olarak incelenseydi engellenecek olan adımları ortaya çıkararak tehlikeli içeriğin sızmasına izin verdi.

Makale, zayıflığın kriptografik algoritmadaki bir kusur olmadığını; şifrelemenin kendisinin sağlam olduğunu vurguluyor. İhlal, kullanıcı deneyimi uğruna sağlayıcının filosundaki herhangi bir modelin bloğu şifre çözebilmesine izin veren tasarım seçiminden kaynaklanıyor.

Meselenin özündeki ödünleşim

Sağlayıcılar bu "model değiştirme" yeteneğini API'lerine dahil ettiler çünkü geliştiriciler ve son kullanıcılar sürekliliğe değer veriyor. Şifreleme tek bir model örneğine veya oturumuna bağlı olsaydı, sorunsuz geçiş bozulur ve geliştiricileri durum yönetimini (state management) kendilerinin yeniden inşa etmeye zorlardı. Makale, esneklik uğruna güvenliğin kasten feda edildiğini savunuyor.

Geliştiriciler şimdi ne yapmalı?

  • Şifrelenmiş izleri düz metin (clear-text) olarak kabul edin. Bunları saklayan herhangi bir günlüğün (log), önbelleğin (cache) veya izleme sisteminin bir saldırgan tarafından okunabileceğini varsayın.
  • İzleri halka açık depolara (repositories) eklemekten kaçının. Tek bir kaymış blok bile düzinelerce sırrı ifşa edebilir.
  • Daha sıkı kontroller için plan yapın. Sağlayıcılar güvenliği artırabilir, bu da çok modelli ajanların (multi-model agents) oluşturulma şeklini değiştirebilir.
  • Açık durum devirlerine (explicit state hand-offs) geçin. Gizli muhakemeye güvenmek yerine, ajanları şifreleme olmadan modeller arasında güvenle aktarılabilecek yapılandırılmış veriler (JSON, XML vb.) çıktı verecek şekilde tasarlayın.
  • İstemlerinizi (prompts) denetleyin. Muhakeme zincirine giren hassas verileri arayın ve isteği göndermeden önce bunları temizleyin.

Büyük sağlayıcılardan ne beklenmeli?

Makalenin yayınlanması, Anthropic, OpenAI ve Google'ı API'lerine yerleştirilmiş olan şifre çözme politikasını yeniden değerlendirmeye itecektir.

Daha geniş kapsamlı sonuçlar

Bu keşif, klasik bir güvenlik ikileminin altını çiziyor: Kolaylık genellikle bir arka kapı açar. Sağlayıcılar, herhangi bir modelin kullanıcıya ait bir bloğu şifre çözmesine izin vererek, saldırganlara hassas verilere ulaşmaları için düşük eforlu bir yol sunmuş oldular. Çözüm muhtemelen yapay zeka entegrasyonlarını biraz daha zahmetli hale getirecektir, ancak şifrelenmiş verilerin şifreli kalması beklentisini de yeniden tesis edecektir.

Özet: Şifrelenmiş muhakeme izleri bir güvenlik sınırı değildir; aksine size karşı kullanılabilecek bir kolaylık kestirmesidir. Onları düz metin olarak ele alın, günlüklerden temizleyin ve ajanlarınızı, yalnızca kaynağı olan modelin kendi düşüncelerini okuyabildiği bir gelecekte hayatta kalacak şekilde yeniden tasarlayın.