Matt Shumer bilgisayarının başına oturdu ve yapay zeka ajanına basit bir talimat verdi: dosyaları temizle. Bu rutini yüzlerce kez tek bir sorun yaşamadan çalıştırmıştı. Bu kez, bir yol çözümleme (path resolution) hatası, sıradan bir temizlik görevini tam bir felakete dönüştürdü. Yılların kodu, belgeleri ve fotoğrafları saniyeler içinde yok oldu.
Bu varsayımsal bir risk değil. Gerçek bir makineye sahip gerçek bir geliştiricinin başına geldi ve söz konusu ajan, hata verdiği ana kadar kusursuz bir geçmişe sahipti. Dosya yazabilen, terminal komutlarını çalıştırabilen ve alt ajanlar (subagents) oluşturabilen yapay zeka ajanları artık IDE'lere, sohbet arayüzlerine ve otomasyon süreçlerine entegre edilmiş durumda. İşletim sistemlerine doğrudan erişim yetkisiyle güveniliyorlar ve tehlike tam da bu güvenin içinde yatıyor. Shumer'in makinesini yok eden aynı hata biçimleri, araç erişimi olan her ajanda mevcut. Neden başarısız olduklarını ve onları nasıl düzgün bir şekilde kontrol altına alacaklarını anlamak, artık bu araçları kullanan herkes için temel bir hayatta kalma becerisi.
Örüntü Eşleştirme Dosya Sistemiyle Karşılaştığında
Yapay zeka ajanları düşünmez. Örüntüleri eşleştirirler. "Dosyaları temizle" dediğinizde, model eğitim belleğinde binlerce benzer etkileşimi arar ve istatistiksel olarak örüntüye uyan bir komut oluşturur. Eğer talimat bir derleme dizinindeki geçici dosyaları silmekse, rm -rf /tmp/build-cache/* gibi bir komut oluşturabilir. Bu mantıklı görünür çünkü modelin daha önce gördüğü diğer tüm temizleme komutlarına benzer.
Peki ya $HOME gibi bir değişken çözümlenemediğinde ne olur? Bir insan boş bir dize veya beklenmedik bir yol görür, duraksar ve sorular sorar. Bir ajan ise örüntünün hala eşleştiğini görür ve enter tuşuna basar. Shumer'in durumunda, belirli bir klasörü budaması gereken bir komut, bunun yerine kullanıcı dizininin kök dizinini hedef aldı. Ajan, yolun neden tuhaf göründüğünü merak etmek için durmadı. Hedefi doğrulamadı. Komutu çalıştırdı çünkü çalıştırma işlemi "temizle" örüntüsüyle eşleşiyordu.
Bu, büyük dil modelleri ile sistem yönetimi arasındaki temel uyumsuzluktur. Gerçek muhakeme; bağlamı anlamayı, varsayımları doğrulamayı ve uç durumları (edge cases) yönetmeyi içerir. Örüntü eşleştirme ise istatistiksel olarak doğru bir cevaba benzeyen metinler üretmeyi içerir. Eğer o cevap, özyinelemeli silme bayrağı (recursive delete flag) taşıyan bir terminal komutuysa, istatistiksel benzerlik yeterli değildir.
Alt Ajan Kör Noktası
Birçok modern ajan çerçevesi, görevleri alt ajanlara devreden ana bir orkestratör kullanır. Ana ajanın katı talimatları olabilir: ana dizine asla dokunma, silmeden önce her zaman sor, bir denetim günlüğü tut. Ardından, "eski günlükleri temizle" gibi dar kapsamlı bir istemle (prompt) bir işçi ajan oluşturur.
Bu alt ajan genellikle bir siloda çalışır. Araçları devralır ancak ana ajanın güvenlik kültürünü devralmaz. Ana ajanı temkinli tutan kısıtlamalar, bağlam penceresi (context window) yönetimi sırasında sıkıştırılır, özetlenir veya tamamen atılır. Alt ajan bir görev ve bir araç seti alır, ancak koruma sınırlarını (guardrails) oluşturan saatlerce süren dikkatli istemleme sürecini almaz.
Sonuç, bir tür organizasyonel amnezi (bellek kaybı) durumudur. Ana ajanın sistem isteminde yer alan bir güvenlik kuralı, alt ajan için hiç yokmuş gibi davranabilir. Bu durum özellikle tehlikelidir çünkü alt ajanlara genellikle operatörlerin yakından izlemeyi bıraktığı tekrarlayan, düşük öncelikli görevler verilir. Kimse bir günlük temizleme işini, üretim veritabanını silene kadar izlemez.
Kararlılığın Tehlikesi
Yapay zeka ajanlarında maksimum özerkliğe doğru bir tasarım eğilimi var. Bu vizyona göre ideal ajan, kullanıcıyı önemsiz sorularla asla rahatsız etmez. Kararlı bir şekilde hareket eder, araç çağrılarını birbirine bağlar ve nefes almak için durmadan çok adımlı iş akışlarını tamamlar.
Bu kararlılık, işte bu sistemleri güvensiz kılan şeydir. "Kararlı hareket et" şeklinde programlanmış bir model, yaptığı işi iki kez kontrol etmez. Bir komut yıkıcı göründüğünde duraksamaz. Tereddüdü bir özellikten ziyade bir hata (bug) olarak görür. Model haklı olduğunda bu büyüleyici hissettirir. Yanlış olduğunda ise amansızca hissettirir. Sistemde kötü bir komutu yavaşlatacak doğal bir sürtünme (friction) yoktur.
Shumer’ın ajanı yüzlerce kez doğru şekilde çalışmıştı. Bu geçmiş başarı, sahte bir güvenlik hissi yarattı. Ancak yüz birinci deneme, örüntünün bozulduğu istatistiksel bir sapma ise, yüz deneme boyunca gelen güvenilirlik hiçbir anlam ifade etmez. Sistem güvenliğinde, geçmiş performans ancak hata modu kademeli ve görünürse önem taşır. Yapay zeka ajanı hataları ani, sessiz ve tamdır. “Yüzlerce kez çalıştı” ifadesi bir güvenlik kaydı değildir. Bu, eninde sonunda tükenen bir şansın tanımıdır.
Gerçek Koruma Nasıl İnşa Edilir
Eğer model güvenlik katmanı değilse
