Epic'in sepsis uyarı motoru, Michigan Medicine'daki 2021 doğrulama testinde başarısız oldu; tüm başvuruların %18'i için alarm çalarken, daha sonra sepsis geliştiren hastaların üçte ikisini gözden kaçırdı. Bu hata, klasik bir veri sızıntısı hatasına dayanıyor: Model, enfeksiyon şüphesi gösteren bir işaret olan doktorun antibiyotik reçetesini bir tahminleyici olarak saydı ve aslında klinisyenin zaten vermiş olduğu bir kararı tekrarladı.

Model neden başarısız oldu

Michigan ekibi, tipik bir çok yıllık kalite iyileştirme projesi boyutunda olan 38.455 hastanede yatış vakasını inceledi. Epic'in dahili kıyaslama ölçütleri yüksek doğruluk vaat ediyordu ancak bağımsız test bunun tam tersini gösterdi. Modelin "yüksek risk" uyarıları hastaların neredeyse beşte birinde tetiklendi, ancak gerçek sepsis vakalarının üçte ikisi fark edilmeden kaçtı. Uygulamada sistem, yakalaması gereken olayları kaçırırken çok sık "dikkat et" diye bağırıyordu.

Temel neden makine öğrenmesi algoritmasının kendisindeki bir kusur değil, ona beslenen verilerdi. Model, bir antibiyotik reçetesinin varlığını bir girdi olarak kullanarak, klinisyenin halihazırda vermiş olduğu seçimi tahmin etmeyi öğrendi. Algoritma bir hastayı işaretlediğinde, bunu genellikle hastanın fizyolojisi yaklaşan bir sepsisi işaret ettiği için değil, doktorun zaten antibiyotik reçete etmiş olması nedeniyle yapıyordu.

Hastane yapay zekasında daha geniş bir sorun

Epic'in sepsis modeli yıllardır yüzlerce hastanede kullanılıyor, ancak sızıntı hatası, odaklanmış bir doğrulama çalışması ortaya çıkarana kadar gizli kaldı. Bu olay sistemsel bir zayıflığı örneklendiriyor: Çoğu sağlık sistemi yapay zeka projesi, bu tür sorunları erkenden yakalamak için gereken operasyonel kontrollerden yoksun.

  • Dış testlerin olmaması – Hastanelerin dış testleri yoktu.
  • Sürekli izleme yapılmaması – İzleme süreçleri yoktu.
  • Net bir sorumluluk olmaması – Veri kalitesi ve model performansından sorumlu belirlenmiş bir ekip olmadığında, sorunlar gözden kaçar.

Bu boşluklar, birçok yapay zeka girişiminin bir kavram kanıtlama (proof-of-concept) aşamasının ötesine geçemeyerek "pilot aşamasında sıkışıp kalmasına" neden oluyor.

Parçalı verilerin gizli maliyeti

Sepsis vakası aynı zamanda parçalı sağlık bilişimi ekosistemlerinin yapay zekayı nasıl sabote ettiğini de gösteriyor. Yaygın engeller şunlardır:

  • Verileri otomatik olarak paylaşmayan eski nesil EHR modüllerinde kilitli kalan hasta kayıtları.
  • Birbirleriyle iletişim kuramayan ve manuel dosya transferine zorlayan görüntüleme ve laboratuvar sistemleri.
  • Tek bir kişinin verilerini birden fazla tabloya bölen mükerrer hasta tanımlayıcıları.
  • Model eğitimi için asla birleştirilmeyen, ayrı silolarda saklanan klinik notlar ve hayati belirtiler.

Bir model temiz ve küratörlü bir veri seti üzerinde eğitilip ardından canlı ve karmaşık verilerle beslendiğinde, performans sessizce düşer. Klinisyenler güvenlerini hızla kaybeder; birden fazla ekran arasında uyarıları takip etmek zorunda kalan bir hemşire, altta yatan algoritma teknik olarak sağlam olsa bile onları görmezden gelecektir.

Güvenilir yapay zeka için dört "sıkıcı" temel

İşlevsel bir yapay zeka dağıtımı, nadiren manşetlere taşınan dört pratik yetkinliğe dayanır:

  1. Birlikte çalışabilirlik (Interoperability) – Veriler; manuel dışa aktarma-içe aktarma adımları olmadan EHR'ler, laboratuvarlar, görüntüleme platformları ve karar destek araçları arasında akmalıdır.
  2. Yönetişim (Governance) – Sorumlu bir kişi veya ekip, veri kalitesine sahip olmalı ve model çıktılarını zaman içinde izlemelidir.
  3. İş akışı entegrasyonu – Uyarılar, klinisyenin mevcut iş kuyruğu içinde görünmelidir; ekstra tıklamalar veya ekranlar benimsenmeyi engeller.
  4. Ölçeklenebilir operasyonlar – Model üretime geçmeden önce otomatik izleme, uyarı yorgunluğu analizi ve periyodik yeniden eğitim süreçleri esastır.

Bu adımlardan herhangi birini atlamak, bir projeyi Epic sepsis modelinde görülen türden sessiz başarılara karşı savunmasız bırakır.

Bir yapay zeka çözümü satın almadan önce sorulması gereken sorular

Hastaneler, somut yanıtlar talep ederek maliyetli hatalardan kaçınabilir:

  • Modelin kullanacağı her sistemde tek bir hastanın verisini takip edebiliyor musunuz?
  • Veri kalitesini korumaktan ve model performansını denetlemekten isim olarak kim sorumlu?
  • Uyarılar, sadece bir sandbox ortamında değil, gerçek bir vardiya sırasında klinisyenlerle test edildi mi?
  • Performans kaymasının (performance drift) nasıl tespit edileceğini ve ele alınacağını belirten belgelenmiş bir izleme planı var mı?

Eğer satıcı bir kişiyi, bir süreci veya bir izleme panelini işaret edemiyorsa, kuruluş durmalı ve durumu yeniden değerlendirmelidir.

Çıkarılması gereken ders

Epic sepsis modeli, makine öğreniminin hastaneler için uygun olmaması nedeniyle başarısız olmadı; çevresindeki veri hattı ve yönetişim yapılarının eksik olması nedeniyle başarısız oldu. Bir doktorun kendi kararını tahmin eden bir model, algoritmanın değil, veri mühendisliği katmanının geliştirilmesi gerektiğini göstermektedir. Sağlık hizmetlerinde güvenilir yapay zeka inşa etmek, herhangi bir kritik BT sistemini çalışır durumda tutan aynı "sıkıcı" altyapıyı gerektirir: temiz ve bağlantılı veriler, net bir hesap verebilirlik, iş akışına entegre uyarılar ve proaktif izleme. Bunlar olmadan, en gelişmiş model bile sonunda yanlış insanlara yanlış uyarılar haykıracaktır.