Epic의 패혈증 경고 엔진은 2021년 Michigan Medicine에서 실시한 검증에서 실패했다. 이 엔진은 전체 입원 사례의 18%에 대해 경고를 울리면서도, 이후 패혈증으로 발전한 환자의 3분의 2를 놓쳤다. 이러한 실수는 전형적인 데이터 누수(data-leakage) 오류에서 기인했다. 모델이 이미 감염이 의심된다는 신호인 의사의 항생제 처방을 예측 인자로 계산함으로써, 결과적으로 임상의가 이미 내린 결정을 그대로 반복하는 오류를 범한 것이다.
모델이 실패한 이유
미시간 팀은 전형적인 다년 단위 품질 개선 프로젝트 규모인 38,455건의 입원 사례를 조사했다. Epic의 내부 벤치마크는 높은 정확도를 약속했지만, 독립적인 테스트 결과는 정반대였다. 모델의 "고위험" 경고는 환자의 약 5분의 1에서 발생했지만, 실제 패혈증 사례의 3분의 2는 인지되지 못한 채 지나쳤다. 실제로 이 시스템은 포착해야 할 바로 그 사건들을 놓치면서도 너무 자주 "주의하라"고 소리치고 있었다.
근본 원인은 머신러닝 알고리즘 자체의 결함이 아니라 입력된 데이터에 있었다. 항생제 처방 여부를 입력값으로 사용함으로써, 모델은 임상의가 이미 내린 선택을 예측하는 법을 학습해 버렸다. 알고리즘이 환자에게 경고를 보낼 때, 그것은 환자의 생리학적 상태가 패혈증 임박을 나타내기 때문이 아니라 의사가 이미 항생제를 처방했기 때문인 경우가 많았다.
병원 AI의 더 넓은 문제
Epic의 패혈증 모델은 수년 동안 수백 개의 병원에 배포되었지만, 이러한 누수 오류는 집중적인 검증 노력이 이루어지기 전까지 숨겨져 있었다. 이 사례는 시스템적인 취약점을 보여준다. 대부분의 의료 시스템 AI 프로젝트에는 이러한 문제를 조기에 발견하는 데 필요한 운영 점검 체계가 부족하다.
- 외부 테스트 부재 – 병원들은 외부 테스트를 수행하지 않았다.
- 지속적인 모니터링 부재 – 모니터링 체계가 없었다.
- 명확한 책임 주체 부재 – 데이터 품질과 모델 성능을 책임지는 지정된 팀이 없으면 문제는 방치된다.
이러한 격차로 인해 많은 AI 이니셔티브가 개념 증명(proof-of-concept) 단계를 넘어 진전하지 못한 채 "파일럿 지옥(pilot purgatory)"에 갇혀 있다.
파편화된 데이터의 숨겨진 비용
패혈증 사례는 파편화된 헬스 IT 생태계가 어떻게 AI를 방해하는지도 보여준다. 일반적인 장애물은 다음과 같다:
- 데이터를 자동으로 교환하지 못하는 레거시 EHR 모듈에 갇힌 환자 기록.
- 서로 통신할 수 없어 수동 파일 전송을 강제하는 영상 및 실험실 시스템.
- 한 사람의 데이터를 여러 차트에 분산시키는 중복된 환자 식별자.
- 모델 학습을 위해 통합되지 않고 별도의 사일로(silo)에 저장된 임상 노트 및 활력 징후.
모델이 깨끗하게 정제된 데이터셋으로 학습된 후, 실제 현장의 무질서한 데이터가 입력되면 성능은 조용히 저하된다. 임상의들은 빠르게 신뢰를 잃는다. 여러 화면을 오가며 경고를 쫓아야 하는 간호사는 설령 근본 알고리즘이 기술적으로 건전하더라도 결국 경고를 무시하게 될 것이다.
신뢰할 수 있는 AI를 위한 네 가지 "지루한" 토대
기능적인 AI 배포는 뉴스 헤드라인에는 거의 오르지 않는 네 가지 실질적인 역량에 달려 있다:
- 상호운용성(Interoperability) – 데이터는 수동적인 내보내기 및 가져오기 단계 없이 EHR, 실험실, 영상 플랫폼 및 의사 결정 지원 도구 간에 원활하게 흘러야 한다.
- 거버넌스(Governance) – 책임 있는 개인이나 팀이 데이터 품질을 소유하고 시간이 지남에 따라 모델 출력을 모니터링해야 한다.
- 워크플로우 통합(Workflow integration) – 경고는 임상의의 기존 작업 대기열 내에 나타나야 한다. 추가적인 클릭이나 화면 전환은 도입을 저해한다.
- 확장 가능한 운영(Scalable operations) – 모델이 실제 운영 단계에 도달하기 전에 자동화된 모니터링, 경고 피로도 분석, 주기적인 재학습 파이프라인 구축이 필수적이다.
이 단계 중 어느 하나라도 건너뛰면 프로젝트는 Epic의 패혈증 모델에서 나타난 것과 같은 조용한 실패에 취약해진다.
AI 솔루션 구매 전 던져야 할 질문들
병원들은 다음과 같은 구체적인 답변을 요구함으로써 비용이 많이 드는 실수를 피할 수 있다:
- 모델이 사용할 모든 시스템에 걸쳐 단일 환자의 데이터를 추적할 수 있는가?
- 데이터 품질을 유지하고 모델 성능을 감독할 책임자는 누구(이름 명시)인가?
- 경고 시스템이 단순히 샌드박스 환경이 아닌, 실제 근무 시간 동안 임상의들과 함께 테스트되었는가?
- 성능 드리프트(performance drift)를 어떻게 식별하고 해결할지 명시된 문서화된 모니터링 계획이 있는가?
만약 벤더가 특정 인물, 프로세스 또는 모니터링 대시보드를 제시하지 못한다면, 조직은 검토를 중단하고 재평가해야 한다.
시사점
Epic 패혈증 모델이 실패한 이유는 머신러닝이 병원에 부적합해서가 아니라, 이를 둘러싼 데이터 파이프라인과 거버넌스 구조가 부재했기 때문입니다. 의사의 결정을 그대로 예측하는 모델은 알고리즘이 아닌 데이터 엔지니어링 계층에 개선이 필요하다는 경고를 던집니다. 헬스케어 분야에서 신뢰할 수 있는 AI를 구축하려면, 모든 핵심 IT 시스템을 유지하는 데 필요한 것과 동일한 '지루한' 인프라가 필요합니다. 즉, 깨끗하고 연결된 데이터, 명확한 책임 소재, 워크플로에 통합된 알림, 그리고 선제적인 모니터링이 뒷받침되어야 합니다. 이러한 요소가 없다면, 아무리 정교한 모델이라 할지라도 결국 엉뚱한 사람에게 잘못된 경고를 보내는 결과만 초래할 것입니다.
