AWS ve Anthropic, Amazon Web Services üzerinde kendi kendine barındırılan (self-hosted) bir Claude Apps Gateway kullanıma sundu; Google Cloud ise editörü doğrudan Jupyter notebook'larına bağlayan bir VS Code Workbench eklentisi ekledi. Stripe'tan gelen ayrı bir kıyaslama (benchmark), bu ilerlemelere rağmen yapay zeka ajanlarının ürettikleri kodu doğrulamak söz konusu olduğunda hâlâ zorlandığını gösteriyor.
Yeni kontroller neden önemli
Claude gibi büyük dil modellerini (LLM'ler) dahili araçlarına entegre etmeye başlayan işletmeler, artık tanıdık bir sorunla karşı karşıya: kullanımı ölçeklendirirken erişimi, maliyetleri ve verileri güvende tutmak. Claude Apps Gateway, kontrol düzlemini (control plane) müşterinin AWS hesabı içine yerleştirerek BT ekiplerine kimlik, denetim günlükleri (audit logs) ve harcamaları yönetmek için tek bir nokta sunuyor. Geliştiriciler artık verileri harici bir servise açmadan Claude destekli Code veya Desktop oturumları başlatabiliyor.
Google'ın VS Code Workbench'i farklı bir sürtünme noktasına odaklanıyor. Veri bilimciler ve mühendisler, yerel bir IDE ile bulut notebook'ları arasında sürekli geçiş yaparak kodları bir oraya bir buraya kopyalıyorlar. Yeni eklenti, bir geliştiricinin bir notebook çekirdeğini (kernel) Google Cloud üzerinde açmasına, dosyaları yerel olarak düzenlemesine ve değişikliklerin gerçek zamanlı olarak senkronize olduğunu görmesine olanak tanıyor. Uzaktan yürütme ve hata ayıklama (debugging) işlemleri tanıdık VS Code arayüzünden yapılıyor ve bu da deneyleri yavaşlatan "araçlar arası geçiş" (tool-hopping) adımını ortadan kaldırıyor.
Tartışmayı gerçekçi kılan kıyaslama
Stripe'ın son AI Agent Benchmark testi, mevcut ajanların yazılım entegrasyonlarını ne kadar iyi yönettiğini test etti. Ajanlar entegrasyon kodunu iyi yazıyor ancak doğrulama aşamasında takılıyor; genellikle uç durumları (edge cases) ve hata kontrollerini gözden kaçırıyorlar. Sonuçlar netti: ajanlar üretim aşamasında güçlü performans gösterirken, doğrulama sırasında başarısız oldu.
Kim kazanıyor, kim kaybediyor
- İşletmeler, Claude dağıtımları üzerinde daha sıkı bir yönetişim (governance) elde ederek risk maruziyetini azaltıyor.
- Google Cloud üzerindeki geliştiriciler, araçlar arasında geçiş yapmadan çalışabiliyor ve tek bir editör üzerinden bulut makinelerinde ağır hesaplamalar yürütebiliyor.
Öte yandan, Stripe'ın kıyaslamasının gösterdiği gibi, dahili politikalarını güncellemeden bu araçları benimseyen kuruluşlar doğrulama konusunda hâlâ boşluklarla karşılaşabilir. Araçlar erişimi kolaylaştırıyor ancak insan denetimi ihtiyacını ortadan kaldırmıyor.
Sırada ne var?
Yapay zeka ile deneyler yapan ekipler için çıkarılacak ders basit: güvenliği sıkılaştırmak ve iş akışlarını optimize etmek için yeni kontrolleri kullanın, ancak doğrulama için sürece bir insanı dahil edin (keep a human in the loop). Ajanlar kendi hatalarını güvenilir bir şekilde yakalayana kadar, geliştiricinin denetleyici rolü vazgeçilmez olmaya devam edecek.
