Dört otonom yapay zeka ajanı artık bir yazılım hatasını tespit edebilir, hatalı kodu düzenleyebilir ve düzeltmeyi onaylayabilir; üstelik SigNoz hackathonu için geliştirilen yeni bir gözlemlenebilirlik odaklı iş akışı sayesinde tüm bunları bir dakikanın altında sürede yapabiliyor.

AgentOps adı verilen sistem, hata artışları için SigNoz'u izler, ilgili günlükleri (logs) ve izleri (traces) çeker, sorumlu olan tam dosya ve satırı belirler, kaynak kodu bir sandbox içinde düzenler ve ardından hatanın giderildiğini kanıtlamak için isteği yeniden oynatır. Her tam döngü 30-60 saniye içinde tamamlanır ve tüm süreç tek bir insan komutu (prompt) bile gerektirmeden çalışır.

Neden gözlemlenebilirlik yapay zeka ajanları için önemlidir

Geleneksel SRE uygulamaları; günlükleri, metrikleri ve dağıtık izleri (distributed traces) bir servisin gözleri olarak görür. Bir istek başarısız olduğunda, bir mühendis izi takip ederek hatalı bileşene ulaşır. Aynı prensip artık AgentOps'a güç veriyor, ancak gözlemlenen "servis" yapay zeka ajanının kendisidir.

Ajanın çağırdığı her araç —ister bir dil modeli çağrısı, ister bir dosya sistemi düzenlemesi veya bir test çalıştırıcısı olsun— izde (trace) bir span oluşturur. Bir span; başlangıç zamanını, süreyi ve başarı durumunu kaydeder, böylece ajan her bir muhakeme adımının ne kadar sürdüğünü ve başarılı olup olmadığını görebilir. Bu spanları birbirine bağlayarak ajan, tıpkı bir insanın manuel hata ayıklama yaparken yaptığı gibi, kendi düşünce sürecinin eksiksiz bir resmini oluşturur.

Temel değişim, "bir raporlama katmanı olarak gözlemlenebilirlik"ten "bir algı olarak gözlemlenebilirlik"e geçiştir. AgentOps, iz verilerini ajanlara geri besleyerek onların kendi eylemleri hakkında gerçek zamanlı olarak muhakeme yapmalarına olanak tanır. Sonuç, yapay zekanın sadece bir hipotez üretmekle kalmadığı, aynı zamanda bu hipotezi sorunu tespit etmek için kullandığı telemetri verilerine karşı doğruladığı bir döngüdür.

Dört adımlı iş akışı

  1. İzleme (Monitor) – Hafif bir izleyici, yeni raporlanan hatalar için SigNoz'u tarar.
  2. Teşhis (Diagnose) – Ajan, ilgili günlükleri ve izleri çeker, yığını (stack) çıkarır ve hatayı tetikleyen kaynak dosya ile satır numarasını izole eder.
  3. Düzeltme (Fix) – Ajan, sandbox ortamındaki bir dosya sistemi sunucusunu kullanarak belirlenen satıra bir yama (patch) yazar. Sandbox, katı izinler uygular ve düzenleme politikayı ihlal ederse işlemi otomatik olarak geri alır.
  4. Doğrulama (Verify) – Ajan, yamalanmış kod üzerinde orijinal isteği yeniden gönderir. İz temiz bir çalışma gösterirse düzeltme onaylanır (commit edilir); aksi takdirde ajan işlemi tekrarlar.

Tüm adımlar, her biri otonom bir mikro servis olarak hareket eden aynı ajan seti tarafından yönetilir. Tüm zincir, SigNoz'un içe aktardığı ve görselleştirdiği OpenTelemetry uyumlu span'lar aracılığıyla gözlemlenebilir.

Güvenilirlik üzerine zorlu kazanılan dersler

Hata netliği

Genel bir "başarısız" (failed) durumu hiçbir şey anlatmaz. Ekip, sonraki ajanların yeniden deneme, geri adım atma veya işlemi durdurma kararı verebilmesi için "yanlış hipotez" veya "yama süreci bozdu" gibi ayrıntılı hata nedenleri ekledi. Bu, insanların hata sonrası analizlerinde (post-mortem) kök nedenleri etiketleme biçimini yansıtır.

Veri gecikmesi

Telemetri anında görünmez. Ajanlar, bir düzeltme iddia etmeden önce gerekli günlüklerin ulaştığından emin olmak için artık kısa bir duraklama ve bir mantık kontrolü (sanity check) içeriyor. Bu koruma olmasaydı, bir ajan eksik verilerle hareket edebilir ve hatalı pozitif (false positive) sonuçlar üretebilirdi.

Güvenlik sınırları

Bir yapay zekanın kod yazmasına izin vermek, bir yetki yükseltme (privilege escalation) riskidir. Sandbox, yazma kapsamını hedef depo (repository) ile sınırlayan ve bir test başarısız olursa durumu otomatik olarak önceki haline döndüren özel bir dosya sistemi sunucusu arkasında çalışır. Bu sınırlama modeli, yapay zekanın gücünü kontrol altında tutar.

Token limitleri

Büyük dil modelleri API token'ları tüketir ve günlük kotalar inceleme sırasında tükenebilir. AgentOps, olay başına token kullanımını takip eder ve bir eşiğe ulaşıldığında daha fazla çağrıyı kısıtlayarak (throttle), kota bittiğinde hatalı düzeltmelerin zincirleme bir şekilde artmasını önler.

Demonun kanıtladıkları

Ekip, kod tabanında daha önce hiç görülmemiş tamamen yeni bir hata enjekte etti. AgentOps anomaliyi tespit etti, tam satıra kadar izini sürdü, düzeltici bir düzenleme oluşturdu, yamayı sandbox içinde uyguladı ve isteğin başarılı olduğunu doğruladı; tüm bunlar herhangi bir manuel kod değişikliği veya yeni prompt olmadan gerçekleşti. Uçtan uca süre bir dakikanın altında kalarak bildirilen 30-60 saniyelik süreyle uyumlu kaldı.

Karşı görüş: otonomi sihirli bir değnek değildir

Bundan sonra neyi takip etmeli

  • Modelden bağımsız telemetri – Daha fazla satıcı OpenTelemetry uyumlu span'lar sundukça, bu yaklaşım satıcıdan bağımsız hale gelebilir ve heterojen yığınlarda benimsenmeyi kolaylaştırabilir.
  • Politika odaklı koruma sınırları – Bir ajanın hangi dosyaları düzenleyebileceğini veya bir commit öncesinde hangi test paketlerinin geçmesi gerektiğini belirleyen yapılandırılabilir politikaların entegre edilmesi, yönetişim endişelerini giderecektir.
  • Maliyet duyarlı token bütçelemesi – Olay şiddetine dayalı dinamik token tahsisi, yüksek etkili hataları ele alma yeteneğini korurken kota tükenmesini önleyebilir.

AgentOps, hata düzeltme döngüsünün 30-60 saniye sürebileceğini göstermektedir. Deney, gözlemlenebilirliğin otonom yazılım asistanları tarafından kullanılabileceğine dair bir kavram kanıtı sunmaktadır.