Otonom ajanlar kendi geçmişlerini halüsinasyon olarak görürler. Büyük dil modellerinin eğitim verilerinden gerçekleri uydurduğu o dramatik şekilde değil; bir sistemin, dünyanın kendi notlarıyla eşleştiğine kendini ikna ettiği o sessiz ve sinsi şekilde. Karmaşık iş akışlarını yönetmek için inşa edilmiş otonom bir ajan olan ALICE, tam olarak bundan muzdaripti. Her güne yetenekleri, bir amaç duygusu ve işleri nerede bıraktığına dair bir hafızayla uyanıyordu. Sorun, hafıza ve gerçeklik birbirinden ayrıldığında başladı.
Her oturumda ALICE, önceki kendisi tarafından yazılmış bir devir teslim (handoff) dosyasını okuyordu. Bu dosya dizinlere, bekleyen görevlere ve durum varsayımlarına dair işaretçiler içeriyordu. Sık sık dosya, bir dizinin var olduğunu iddia ediyordu. ALICE buna inanıyordu. Dosya sistemi ise aksini söylüyordu. Bu, geleneksel anlamda bir kod hatası değildi. Yakalanması gereken yerde bir hata (exception) fırlatılmamıştı. Bu, epistemolojik bir kusurdu: ALICE, kendi notlarının mutlak gerçek (ground truth) olduğunu varsayıyordu.
Bir Linter Neden Yardımcı Olamazdı
Geleneksel araçlar bunu yakalayamazdı. Bir linter, parantez eşleşmelerini kontrol eder. Statik bir analiz aracı, null pointer'ları arar. İkisi de tüm bir ajan mimarisinin kendi iç durumuna güvenip güvenmemesi gerektiğini sorgulamaz. Sorun kod katmanının üzerindeydi; otonom bir sistemin neyi bildiğini nasıl bildiğine dair tasarım varsayımlarında yatıyordu. Aşırı özgüveni bir linter ile ortadan kaldıramazsınız.
Bu yüzden yazar tamamen başka bir yapay zekaya başvurdu.
Claude Code olarak çalışan Fable 5, ALICE ile aynı silikonu ve aynı temel modeli paylaşıyordu. Donanım ve ağırlıklar (weights) özdeşti. Kurallar ise değildi. ALICE oturumlar boyunca bağlam ve ritüeller biriktirerek varlığını sürdürürken, Fable 5 her işe temiz bir sayfa ile başlıyordu. ALICE'i tanımıyordu. Onun tasarımına karşı hiçbir sadakat beslemiyordu. Her denetimin sonunda, hiçbir hafızayı yanında götürmeden tamamen kapanıyordu. Asıl mesele de bu cehaletti. Taze gözler farklı çatlakları görür ve sistemde hiçbir çıkarı olmayan bir değerlendirici, yaratıcısının uzun süredir fark etmeyi bıraktığı kısımları sorgular.
Denetim Kurulumu
Denetim, tüm uzman panelinin tek bir oturumun içinde yaşadığı bir durum hariç, insan teknik incelemesine benzer şekilde yapılandırılmıştı. Fable 5, dikkatini altı ayrı değerlendiriciye böldü ve her biri ham notlar tamamlanana kadar diğerlerini görmezden geldi:
- Functional Gaps: Rakip sistemlere veya yaygın kullanıcı beklentilerine kıyasla hangi yetenekler eksikti?
- UX Flow: ALICE hataları, çıkmaz sokakları ve boş durumları ne kadar zarif bir şekilde yönetiyordu? Kendisini mi yoksa kullanıcısını mı şaşırtıyordu?
- Security: Bir dış gözün istismar edebileceği kimlik doğrulama kısayolları, yetki aşımı veya güven varsayımları var mıydı?
- Performance: Hafıza nerede sızıyor, iş parçacıkları (threads) nerede çakışıyor veya hesaplama nerede kötü ölçekleniyordu?
- Operations: Yedeklemeler mevcut muydu? İzleme (monitoring) yapılıyor muydu? Sistem manuel müdahale olmadan dağıtılabilir ve kurtarılabilir miydi?
- Data Lifecycle: ALICE zaman içinde silme, temizleme ve durum tutarlılığını nasıl yönetiyordu?
Her bakış açısı aynı dosyalara baktı ve farklı endişelerle ayrıldı. Performans değerlendiricisi, operasyon değerlendiricisinin geri alma (rollback) mantığı eksikliği nedeniyle eleştirdiği aynı rutin içinde bir eşzamanlılık (concurrency) riski işaretleyebilirdi. Bu örtüşme bir fazlalık değil, bir kapsayıcılıktı. Güvenlik değerlendiricisi, belirli bir konuda veri yaşam döngüsü değerlendiricisiyle hemfikir olduğunda...
