Mesin peringatan sepsis Epic gagal dalam validasi tahun 2021 di Michigan Medicine, melewatkan dua pertiga pasien yang kemudian mengalami sepsis, sementara membunyikan alarm untuk 18% dari seluruh penerimaan pasien. Kesalahan ini berakar pada kesalahan kebocoran data (data-leakage) klasik: model tersebut menghitung pesanan antibiotik dokter—yang sudah menjadi tanda bahwa infeksi dicurigai—sebagai prediktor, yang pada dasarnya hanya mengulangi keputusan yang telah dibuat oleh klinisi.

Mengapa model tersebut gagal

Tim Michigan memeriksa 38.455 masa inap rumah sakit, ukuran dari proyek peningkatan kualitas multi-tahun yang tipikal. Tolok ukur internal Epic menjanjikan akurasi tinggi, tetapi pengujian independen menunjukkan hal yang sebaliknya. Peringatan "risiko tinggi" dari model tersebut muncul pada hampir seperlima pasien, namun dua pertiga kasus sepsis yang sebenarnya lolos tanpa terdeteksi. Dalam praktiknya, sistem tersebut terlalu sering berteriak "waspada" sementara melewatkan peristiwa yang seharusnya ditangkap.

Akar masalahnya bukan pada cacat algoritma pembelajaran mesin (machine-learning) itu sendiri, melainkan pada data yang dimasukkan ke dalamnya. Dengan menggunakan keberadaan pesanan antibiotik sebagai input, model tersebut belajar untuk memprediksi pilihan klinisi yang sudah dibuat. Ketika algoritma menandai seorang pasien, hal itu sering kali dilakukan karena dokter telah memesan antibiotik, bukan karena fisiologi pasien menunjukkan sepsis yang akan datang.

Masalah yang lebih luas dalam AI rumah sakit

Model sepsis Epic telah diterapkan di ratusan rumah sakit selama bertahun-tahun, namun kesalahan kebocoran tersebut tetap tersembunyi hingga upaya validasi yang terfokus mengungkapkannya. Insiden ini mengilustrasikan kelemahan sistemik: sebagian besar proyek AI sistem kesehatan kekurangan pemeriksaan operasional yang diperlukan untuk menangkap masalah seperti itu sejak dini.

  • Tidak ada pengujian eksternal – Rumah sakit tidak melakukan pengujian eksternal.
  • Tidak ada pemantauan berkelanjutan – Mereka tidak melakukan pemantauan.
  • Tidak ada kepemilikan yang jelas – Tanpa tim khusus yang bertanggung jawab atas kualitas data dan performa model, masalah akan terabaikan.

Kesenjangan ini membuat banyak inisiatif AI terjebak dalam "stagnasi tahap uji coba" (pilot purgatory), tidak pernah bergerak melampaui tahap pembuktian konsep (proof-of-concept).

Biaya tersembunyi dari data yang terfragmentasi

Kasus sepsis ini juga menunjukkan bagaimana ekosistem TI kesehatan yang terfragmentasi menyabotase AI. Hambatan umum meliputi:

  • Rekam medis pasien yang terkunci dalam modul EHR lama yang tidak bertukar data secara otomatis.
  • Sistem pencitraan dan laboratorium yang tidak dapat berkomunikasi satu sama lain, sehingga memaksa transfer file secara manual.
  • Pengidentifikasi pasien ganda yang memecah data satu orang ke dalam beberapa bagan.
  • Catatan klinis dan tanda-tanda vital yang disimpan dalam silo terpisah, tidak pernah digabungkan untuk pelatihan model.

Ketika sebuah model dilatih pada kumpulan data yang bersih dan terkurasi tetapi kemudian diberi data langsung yang berantakan, performanya akan menurun secara diam-diam. Klinisi akan cepat kehilangan kepercayaan; seorang perawat yang harus mengejar peringatan melalui banyak layar akan mengabaikannya, meskipun algoritma dasarnya secara teknis sudah benar.

Empat fondasi "membosankan" untuk AI yang andal

Penerapan AI yang fungsional bergantung pada empat kemampuan praktis yang jarang menjadi berita utama:

  1. Interoperabilitas – Data harus mengalir di antara EHR, laboratorium, platform pencitraan, dan alat pendukung keputusan tanpa langkah ekspor-impor manual.
  2. Tata kelola (Governance) – Seseorang atau tim yang bertanggung jawab harus memiliki kualitas data dan memantau output model dari waktu ke waktu.
  3. Integrasi alur kerja – Peringatan perlu muncul di dalam antrean kerja klinisi yang sudah ada; klik atau layar tambahan akan menghambat adopsi.
  4. Operasi yang dapat diskalakan – Pemantauan otomatis, analisis kelelahan peringatan (alert-fatigue), dan jalur pelatihan ulang berkala sangat penting sebelum model mencapai tahap produksi.

Melewatkan salah satu dari langkah-langkah ini membuat proyek rentan terhadap jenis kegagalan diam-diam seperti yang terlihat pada model sepsis Epic.

Pertanyaan yang harus diajukan sebelum membeli solusi AI

Rumah sakit dapat menghindari kesalahan yang merugikan dengan menuntut jawaban konkret:

  • Bisakah Anda melacak data satu pasien di setiap sistem yang akan digunakan model?
  • Siapa, dengan nama jelas, yang bertanggung jawab untuk menjaga kualitas data dan mengawasi performa model?
  • Apakah peringatan telah diuji dengan klinisi selama giliran kerja nyata, bukan hanya di lingkungan sandbox?
  • Apakah ada rencana pemantauan terdokumentasi yang merinci bagaimana pergeseran performa (performance drift) akan diidentifikasi dan ditangani?

Jika vendor tidak dapat menunjukkan orang, proses, atau dasbor pemantauan, organisasi harus berhenti sejenak dan mengevaluasi kembali.

Kesimpulan

Model sepsis Epic tidak gagal karena machine learning tidak cocok untuk rumah sakit; model tersebut gagal karena kurangnya data pipeline dan struktur tata kelola di sekitarnya. Model yang memprediksi keputusan dokter itu sendiri memberikan peringatan bahwa lapisan rekayasa data (data-engineering layer), bukan algoritmanya, yang perlu diperbaiki. Membangun AI yang tepercaya dalam layanan kesehatan membutuhkan infrastruktur "membosankan" yang sama yang menjaga sistem IT kritis apa pun tetap berjalan: data yang bersih dan terhubung, akuntabilitas yang jelas, peringatan yang terintegrasi dalam alur kerja, serta pemantauan proaktif. Tanpa hal-hal tersebut, model yang paling canggih sekalipun akan berakhir memberikan peringatan yang salah kepada orang yang salah.