Epics Sepsis-Warnsystem scheiterte 2021 an einer Validierung bei Michigan Medicine: Es übersah zwei Drittel der Patienten, die später eine Sepsis entwickelten, während es bei 18 % aller Aufnahmen Fehlalarme auslöste. Der Fehlgriff lässt sich auf einen klassischen Data-Leakage-Fehler zurückführen: Das Modell wertete die Antibiotika-Verordnung eines Arztes – bereits ein Zeichen für einen Verdacht auf eine Infektion – als Prädiktor aus und spiegelte damit im Wesentlichen eine Entscheidung wider, die der Kliniker bereits getroffen hatte.
Warum das Modell scheiterte
Das Team aus Michigan untersuchte 38.455 Krankenhausaufenthalte, was dem Umfang eines typischen mehrjährigen Qualitätsverbesserungsprojekts entspricht. Epics interne Benchmarks versprachen eine hohe Genauigkeit, doch der unabhängige Test zeigte das Gegenteil. Die „Hochrisiko“-Warnungen des Modells wurden bei fast einem Fünftel der Patienten ausgelöst, doch zwei Drittel der tatsächlichen Sepsis-Fälle blieben unbemerkt. In der Praxis schrie das System viel zu oft „Achtung“, während es genau die Ereignisse übersah, die es eigentlich erfassen sollte.
Die Ursache war kein Fehler im Machine-Learning-Algorithmus selbst, sondern in den eingespeisten Daten zu finden. Durch die Verwendung einer Antibiotika-Verordnung als Eingabewert lernte das Modell, die bereits getroffene Entscheidung eines Klinikers vorherzusagen. Wenn der Algorithmus einen Patienten markierte, geschah dies oft nur deshalb, weil der Arzt bereits Antibiotika angeordnet hatte, und nicht, weil die Physiologie des Patienten auf eine drohende Sepsis hindeutete.
Ein größeres Problem bei KI im Krankenhauswesen
Epics Sepsis-Modell wird seit Jahren in Hunderten von Krankenhäusern eingesetzt, doch der Leakage-Fehler blieb verborgen, bis eine gezielte Validierungsmaßnahme ihn ans Licht brachte. Dieser Vorfall verdeutlicht eine systemische Schwäche: Den meisten KI-Projekten im Gesundheitswesen fehlt es an den operativen Kontrollen, die notwendig sind, um solche Probleme frühzeitig zu erkennen.
- Keine externe Prüfung – Die Krankenhäuser führten keine externen Tests durch.
- Keine kontinuierliche Überwachung – Es gab keine Überwachung.
- Keine klare Verantwortlichkeit – Ohne ein fest zugewiesenes Team, das für die Datenqualität und die Modellleistung verantwortlich ist, gehen Probleme unter.
Diese Lücken führen dazu, dass viele KI-Initiativen im „Pilot-Purgatorium“ stecken bleiben und nie über die Proof-of-Concept-Phase hinauskommen.
Die versteckten Kosten fragmentierter Daten
Der Sepsis-Fall zeigt auch, wie fragmentierte Gesundheits-IT-Ökosysteme die KI sabotieren. Zu den häufigsten Hindernissen gehören:
- Patientenakten, die in veralteten EHR-Modulen gefangen sind, die keinen automatischen Datenaustausch ermöglichen.
- Bildgebungs- und Laborsysteme, die nicht miteinander kommunizieren können, was manuelle Dateiübertragungen erfordert.
- Doppelte Patientenidentifikatoren, die die Daten einer einzelnen Person auf mehrere Akten aufteilen.
- Klinische Notizen und Vitalparameter, die in separaten Silos gespeichert und nie für das Modelltraining zusammengeführt werden.
Wenn ein Modell auf einem sauberen, kuratierten Datensatz trainiert wird, dann aber mit unstrukturierten Live-Daten gefüttert wird, sinkt die Leistung schleichend. Kliniker verlieren schnell das Vertrauen; eine Pflegekraft, die Alarmmeldungen über mehrere Bildschirme hinweg verfolgen muss, wird sie ignorieren, selbst wenn der zugrunde liegende Algorithmus technisch einwandfrei ist.
Vier „langweilige“ Grundlagen für zuverlässige KI
Ein funktionierender KI-Einsatz beruht auf vier praktischen Fähigkeiten, die selten Schlagzeilen machen:
- Interoperabilität – Daten müssen zwischen EHRs, Laboren, Bildgebungsplattformen und Entscheidungsunterstützungstools ohne manuelle Export-Import-Schritte fließen.
- Governance – Eine verantwortliche Person oder ein verantwortliches Team muss die Datenqualität besitzen und die Modellausgaben im Laufe der Zeit überwachen.
- Workflow-Integration – Warnmeldungen müssen innerhalb des bestehenden Arbeitsablaufs des Klinikers erscheinen; zusätzliche Klicks oder Bildschirme verhindern die Akzeptanz.
- Skalierbare Betriebsabläufe – Automatisierte Überwachung, Analysen zur Alarm-Müdigkeit (Alert Fatigue) und periodische Retraining-Pipelines sind essenziell, bevor das Modell in den produktiven Einsatz geht.
Das Überspringen eines dieser Schritte macht ein Projekt anfällig für die Art von schleichendem Versagen, wie es beim Sepsis-Modell von Epic zu sehen war.
Fragen, die man vor dem Kauf einer KI-Lösung stellen sollte
Krankenhäuser können kostspielige Fehltritte vermeiden, indem sie konkrete Antworten verlangen:
- Können Sie die Daten eines einzelnen Patienten über jedes System hinweg nachverfolgen, das das Modell verwenden wird?
- Wer ist namentlich dafür verantwortlich, die Datenqualität aufrechtzuerhalten und die Modellleistung zu überwachen?
- Wurden die Warnmeldungen mit Klinikern während einer echten Schicht getestet und nicht nur in einer Sandbox-Umgebung?
- Gibt es einen dokumentierten Überwachungsplan, der festlegt, wie Leistungsabweichungen (Performance Drift) identifiziert und behoben werden?
Wenn der Anbieter keine Person, keinen Prozess oder kein Überwachungs-Dashboard benennen kann, sollte die Organisation innehalten und das Vorhaben neu bewerten.
Das Fazit
Das Epic-Sepsis-Modell scheiterte nicht daran, dass maschinelles Lernen für Krankenhäuser ungeeignet ist; es scheiterte, weil die flankierenden Datenpipelines und Governance-Strukturen fehlten. Ein Modell, das lediglich die Entscheidung eines Arztes vorhersagt, warnt davor, dass nicht der Algorithmus, sondern die Data-Engineering-Ebene überarbeitet werden muss. Der Aufbau vertrauenswürdiger KI im Gesundheitswesen erfordert dieselbe „langweilige“ Infrastruktur, die jedes kritische IT-System am Laufen hält: saubere, vernetzte Daten, klare Verantwortlichkeiten, in den Workflow integrierte Warnmeldungen und proaktives Monitoring. Ohne diese Elemente wird selbst das hochentwickeltste Modell letztlich die falschen Warnungen an die falschen Personen ausgeben.
