Het sepsis-waarschuwingssysteem van Epic faalde bij een validatie in 2021 bij Michigan Medicine, waarbij twee derde van de patiënten die later sepsis ontwikkelden, werd gemist, terwijl er tegelijkertijd alarm werd geslagen bij 18% van alle opnames. Deze misstap is terug te voeren op een klassieke data-leakage fout: het model telde een antibioticumvoorschrift van een arts — wat al een teken is dat een infectie wordt vermoed — als een voorspeller, waardoor het in feite een beslissing herhaalde die de clinicus al had genomen.

Waarom het model faalde

Het team van Michigan onderzocht 38.455 ziekenhuisopnames, de omvang van een typisch meerjarig project voor kwaliteitsverbetering. De interne benchmarks van Epic beloofden een hoge nauwkeurigheid, maar de onafhankelijke test toonde het tegenovergestelde aan. De 'hoog-risico' waarschuwingen van het model werden afgegeven bij bijna een vijfde van de patiënten, terwijl twee derde van de werkelijke sepsisgevallen onopgemerkt bleef. In de praktijk riep het systeem veel te vaak "pas op", terwijl het juist de gebeurtenissen miste die het had moeten detecteren.

De hoofdoorzaak was geen fout in het machine-learning algoritme zelf, maar in de data die erin werd gevoerd. Door de aanwezigheid van een antibioticumvoorschrift als input te gebruiken, leerde het model een beslissing van een clinicus te voorspellen die al was genomen. Wanneer het algoritme een patiënt markeerde, gebeurde dit vaak omdat de arts al antibiotica had voorgeschreven, en niet omdat de fysiologie van de patiënt op naderende sepsis wees.

Een breder probleem in ziekenhuis-AI

Het sepsis-model van Epic wordt al jaren in honderden ziekenhuizen ingezet, maar de leakage-fout bleef verborgen totdat een gerichte validatie-inspanning het aan het licht bracht. Dit incident illustreert een systemische zwakte: de meeste AI-projecten in de gezondheidszorg missen de operationele controles die nodig zijn om dergelijke problemen vroegtijdig te detecteren.

  • Geen externe testen – De ziekenhuizen hadden geen externe testen.
  • Geen voortdurende monitoring – Ze hadden geen monitoring.
  • Geen duidelijk eigenaarschap – Zonder een toegewezen team dat verantwoordelijk is voor datakwaliteit en modelprestaties, glippen problemen door de mazen van het net.

Deze hiaten zorgen ervoor dat veel AI-initiatieven vast blijven zitten in een "pilot-purgatorium", zonder ooit de fase van een proof-of-concept te overstijgen.

De verborgen kosten van gefragmenteerde data

De sepsis-casus laat ook zien hoe gefragmenteerde gezondheids-IT-ecosystemen AI saboteren. Veelvoorkomende obstakels zijn:

  • Patiëntendossiers die vastzitten in verouderde EHR-modules die geen gegevens automatisch uitwisselen.
  • Beeldvormings- en laboratoriumsystemen die niet met elkaar kunnen communiceren, waardoor handmatige bestandsoverdracht noodzakelijk is.
  • Dubbele patiëntidentificatoren die de gegevens van één persoon over meerdere dossiers verspreiden.
  • Klinische aantekeningen en vitale functies die in aparte silo's worden opgeslagen en nooit worden samengevoegd voor modeltraining.

Wanneer een model wordt getraind op een schone, gecureerde dataset, maar vervolgens live, rommelige data krijgt, neemt de prestatie stilletjes af. Clinici verliezen snel hun vertrouwen; een verpleegkundige die waarschuwingen door meerdere schermen moet volgen, zal ze negeren, zelfs als het onderliggende algoritme technisch gezien deugt.

Vier 'saaie' fundamenten voor betrouwbare AI

Een functionele AI-implementatie rust op vier praktische capaciteiten die zelden de krantenkoppen halen:

  1. Interoperabiliteit – Data moet kunnen stromen tussen EHR's, laboratoria, beeldvormingsplatforms en beslissingsondersteunende tools zonder handmatige export-importstappen.
  2. Governance – Een verantwoordelijke persoon of team moet eigenaar zijn van de datakwaliteit en de output van het model in de loop van de tijd monitoren.
  3. Workflow-integratie – Waarschuwingen moeten verschijnen binnen de bestaande werklijst van de clinicus; extra klikken of schermen remmen de adoptie.
  4. Schaalbare operaties – Geautomatiseerde monitoring, analyse van waarschuwingsmoeheid (alert fatigue) en periodieke hertrainingspipelines zijn essentieel voordat het model in productie gaat.

Het overslaan van een van deze stappen maakt een project kwetsbaar voor het soort stille falen dat bij het sepsis-model van Epic werd gezien.

Vragen om te stellen voordat u een AI-oplossing koopt

Ziekenhuizen kunnen kostbare misstappen voorkomen door concrete antwoorden te eisen:

  • Kunt u de gegevens van een individuele patiënt traceren door elk systeem dat het model zal gebruiken?
  • Wie, bij naam, is verantwoordelijk voor het behoud van de datakwaliteit en het toezicht op de prestaties van het model?
  • Zijn de waarschuwingen getest met clinici tijdens een echte dienst, en niet alleen in een sandbox-omgeving?
  • Is er een gedocumenteerd monitoringsplan dat specificeert hoe prestatieverslechtering (performance drift) wordt geïdentificeerd en aangepakt?

Als de leverancier niet kan wijzen naar een persoon, een proces of een monitoringsdashboard, zou de organisatie moeten pauzeren en de situatie opnieuw moeten beoordelen.

De belangrijkste conclusie

Het Epic sepsis-model faalde niet omdat machine learning ongeschikt is voor ziekenhuizen; het faalde omdat de omliggende datapijplijn en governance-structuren ontbraken. Een model dat de eigen beslissing van een arts voorspelt, waarschuwt dat niet het algoritme, maar de data-engineeringlaag verbeterd moet worden. Het bouwen van betrouwbare AI in de gezondheidszorg vereist dezelfde "saaie" infrastructuur die elk kritiek IT-systeem draaiende houdt: schone, verbonden data, duidelijke verantwoordelijkheid, in de workflow geïntegreerde meldingen en proactieve monitoring. Zonder die elementen zal zelfs het meest geavanceerde model uiteindelijk de verkeerde waarschuwingen naar de verkeerde mensen sturen.