Yapay zeka tarafından üretilen bir açıklama özelliğinde, tek bir güvenlik kapısı metriğinin tam günlük bir kesintiyi gizlediğini fark ettim. "Kapı reddi" ve "model yükleme hatası"nı aynı şey olarak ele alan metrik, sahte bir sistem sağlığı algısı yaratıyordu. Metrik dört reddetme ve sıfır başarı kaydetmişti; ancak o süre zarfında model hiç çalışmamıştı — bu, operatörlerin bozuk bir sisteme karşı kör kalmasına neden olabilecek bir hataydı.
Karışıklık nasıl meydana geldi
Özellik, ham makine mantığını insan tarafından okunabilir cümlelere dönüştürmek için yerel bir dil modeli kullanıyor. Aşağı akıştaki bir güvenlik kapısı, önceden tanımlanmış kuralları ihlal eden tüm çıktıları engelliyor. Üretim ortamında, kapı bir cümleyi reddettiğinde artan tek bir sayaç tanımlamıştım. Drone dört yapay zeka açıklaması kaydettiğinde, sayaç dört reddetme ve sıfır başarılı çıktı raporladı. Ben bunu özelliğin devre dışı kalması olarak değil, güvenlik kapısının görevini yapması olarak yorumladım.
Sayacın maskelediği şey iki aşamalı bir hataydı:
- Modelin çalışmaması – Model, sistemin geri kalanıyla aynı makineyi paylaşıyor. Bellekten tasarruf etmek için ana makine (host), işlem yapılmadığında modeli bellekten boşaltıyor.
- Yeniden yüklemede zaman aşımı – Yeni bir tehdit ortaya çıktığında, sistem yaklaşık iki gigabaytlık model verisini yeniden yüklemeye çalıştı. Yeniden yükleme işlemi otuz saniyelik yanıt zaman aşımı süresini aştı, bu nedenle istek zaman aşımına uğradı ve boş bir yanıt döndürdü.
Sayaç, bir kapı reddi ile zaman aşımından kaynaklanan boş bir yanıtı aynı olay olarak değerlendirdiği için, yapay zeka özelliği aslında çalışmaz durumdayken panelde "çalışan bir güvenlik kapısı" görünüyordu.
Neden önemli
Yapay zeka odaklı ürünlerde, güvenlik kapıları zararlı veya anlamsız çıktıları durdurur. Operatörler, sistem sağlığı sinyali olarak kapının tetiklenme sıklığını izler. Bu sinyal ilgisiz hata modlarıyla birleştiğinde, metrik sessiz bir yalana dönüşür: Servis kullanılamaz durumdayken güven verir.
Görünürlüğü geri kazandıran çözüm
Üç pratik değişiklik yaptım:
- Modeli bellekte tutmak – Yeniden yükleme gecikmesini ortadan kaldırmak için ana makineyi modeli bellekte tutacak şekilde ayarladım.
- Zaman aşımını uzatmak – Ara sıra meydana gelen yavaş yüklemeleri yönetebilmek için yanıt penceresini genişlettim.
- Sayacı bölmek – Tek bir "kapı tarafından reddedildi" metriği yerine dört farklı sayaç getirdim: kabul edildi, reddedildi, boş yanıt ve yanıt yok.
Üçüncü adım belirleyici oldu. Her iki şekilde de okunabilecek tek bir sayı yerine, dört parçalı döküm; güvenlik kapısının aktif olup olmadığını, modelin yanıt verip vermediğini veya isteğin modele hiç ulaşıp ulaşmadığını gösteriyor.
Ödünleşimler ve karşı argümanlar
Bir sonraki adımda nelere dikkat edilmeli
Yapay zeka bileşenlerini devreye alan geliştiriciler, güvenlik kontrollerini sistem düzeyindeki hatalarla harmanlayan tüm birleştirilmiş sayaçları denetlemelidir. Her bir isteğin yolunu —model yükleme başlangıcı, kapı değerlendirmesi, nihai sonuç— kaydeden ayrıntılı bir geçmiş günlüğü oluşturmak, gizli sorunları tespit etmek için gereken adli verileri sağlar.
Özet: Tek bir "kapı reddi" metriği, ölü bir yapay zeka servisini maskeleyebilir; bu metriği bileşen olaylarına ayırmak gerçeği ortaya çıkarır ve aslında çalışmayan bir sisteme karşı yanlış bir güven duygusunu önler.
