Công cụ cảnh báo nhiễm trùng huyết của Epic đã thất bại trong một đợt kiểm chứng vào năm 2021 tại Michigan Medicine, khi bỏ lỡ hai phần ba số bệnh nhân sau đó tiến triển thành nhiễm trùng huyết, trong khi lại phát cảnh báo cho 18% tổng số ca nhập viện. Sai lầm này bắt nguồn từ một lỗi rò rỉ dữ liệu (data-leakage) điển hình: mô hình đã tính toán y lệnh kháng sinh của bác sĩ — vốn đã là một dấu hiệu cho thấy tình trạng nhiễm trùng đang bị nghi ngờ — như một biến dự báo, về cơ bản là lặp lại một quyết định mà bác sĩ lâm sàng đã đưa ra.
Tại sao mô hình thất bại
Đội ngũ của Michigan đã kiểm tra 38.455 ca lưu trú tại bệnh viện, quy mô tương đương với một dự án cải thiện chất lượng kéo dài nhiều năm điển hình. Các tiêu chuẩn đánh giá nội bộ của Epic đã hứa hẹn độ chính xác cao, nhưng kết quả kiểm tra độc lập lại cho thấy điều ngược lại. Các cảnh báo "nguy cơ cao" của mô hình đã được kích hoạt ở gần 1/5 số bệnh nhân, nhưng hai phần ba các trường hợp nhiễm trùng huyết thực tế lại bị bỏ sót mà không được chú ý. Trong thực tế, hệ thống đã hô hoán "cẩn thận" quá thường xuyên trong khi lại bỏ lỡ chính những sự kiện mà nó có nhiệm vụ phải bắt kịp.
Nguyên nhân gốc rễ không nằm ở bản thân thuật toán học máy mà ở dữ liệu được đưa vào đó. Bằng cách sử dụng sự hiện diện của một y lệnh kháng sinh làm đầu vào, mô hình đã học cách dự đoán một lựa chọn vốn đã được bác sĩ lâm sàng đưa ra. Khi thuật toán gắn cờ một bệnh nhân, thường là vì bác sĩ đã ra y lệnh kháng sinh, chứ không phải vì các chỉ số sinh lý của bệnh nhân cho thấy tình trạng nhiễm trùng huyết sắp xảy ra.
Một vấn đề rộng lớn hơn trong AI tại bệnh viện
Mô hình nhiễm trùng huyết của Epic đã được triển khai tại hàng trăm bệnh viện trong nhiều năm, nhưng lỗi rò rỉ dữ liệu vẫn nằm ẩn khuất cho đến khi một nỗ lực kiểm chứng tập trung làm nó lộ diện. Sự việc này minh họa cho một điểm yếu mang tính hệ thống: hầu hết các dự án AI trong hệ thống y tế đều thiếu các bước kiểm tra vận hành cần thiết để phát hiện sớm những vấn đề như vậy.
- Không có kiểm thử bên ngoài – Các bệnh viện không thực hiện kiểm thử độc lập từ bên ngoài.
- Không có giám sát liên tục – Họ không có cơ chế giám sát thường xuyên.
- Không có trách nhiệm rõ ràng – Nếu không có một đội ngũ được chỉ định chịu trách nhiệm về chất lượng dữ liệu và hiệu suất mô hình, các vấn đề sẽ bị bỏ lọt.
Những lỗ hổng này khiến nhiều sáng kiến AI bị mắc kẹt trong "vòng xoáy thử nghiệm", không bao giờ vượt qua được giai đoạn chứng minh khái niệm (proof-of-concept).
Chi phí ẩn của dữ liệu phân mảnh
Trường hợp nhiễm trùng huyết cũng cho thấy các hệ sinh thái CNTT y tế bị phân mảnh đang phá hoại AI như thế nào. Các trở ngại phổ biến bao gồm:
- Hồ sơ bệnh nhân bị khóa trong các mô-đun EHR cũ không thể tự động trao đổi dữ liệu.
- Các hệ thống chẩn đoán hình ảnh và xét nghiệm không thể kết nối với nhau, buộc phải chuyển tệp thủ công.
- Các mã định danh bệnh nhân bị trùng lặp khiến dữ liệu của cùng một người bị chia cắt trên nhiều bệnh án khác nhau.
- Ghi chú lâm sàng và các dấu hiệu sinh tồn được lưu trữ trong các kho dữ liệu riêng biệt, không bao giờ được hợp nhất để huấn luyện mô hình.
Khi một mô hình được huấn luyện trên một tập dữ liệu sạch và đã được tinh lọc, nhưng sau đó lại được nạp dữ liệu thực tế hỗn loạn, hiệu suất sẽ giảm sút một cách âm thầm. Các bác sĩ lâm sàng sẽ nhanh chóng mất niềm tin; một điều dưỡng nếu phải chạy theo các cảnh báo qua nhiều màn hình khác nhau sẽ chọn cách phớt lờ chúng, ngay cả khi thuật toán nền tảng về mặt kỹ thuật là hoàn toàn đúng đắn.
Bốn nền tảng "không mấy hào nhoáng" để có AI đáng tin cậy
Một triển khai AI hiệu quả dựa trên bốn khả năng thực tế vốn hiếm khi xuất hiện trên các tiêu đề báo chí:
- Khả năng tương tác (Interoperability) – Dữ liệu phải lưu chuyển mượt mà giữa các hệ thống EHR, phòng xét nghiệm, nền tảng chẩn đoán hình ảnh và các công cụ hỗ trợ quyết định mà không cần các bước xuất-nhập dữ liệu thủ công.
- Quản trị (Governance) – Một cá nhân hoặc đội ngũ có trách nhiệm phải làm chủ chất lượng dữ liệu và giám sát đầu ra của mô hình theo thời gian.
- Tích hợp quy trình làm việc (Workflow integration) – Các cảnh báo cần xuất hiện ngay trong danh sách công việc hiện tại của bác sĩ lâm sàng; việc phải thực hiện thêm các thao tác nhấp chuột hoặc chuyển màn hình sẽ làm triệt tiêu khả năng ứng dụng.
- Vận hành có khả năng mở rộng (Scalable operations) – Giám sát tự động, phân tích sự mệt mỏi do cảnh báo (alert-fatigue) và các quy trình tái huấn luyện định kỳ là điều thiết yếu trước khi mô hình được đưa vào vận hành chính thức.
Bỏ qua bất kỳ bước nào trong số này sẽ khiến dự án dễ gặp phải kiểu thất bại âm thầm như đã thấy ở mô hình nhiễm trùng huyết của Epic.
Những câu hỏi cần đặt ra trước khi mua một giải pháp AI
Các bệnh viện có thể tránh được những sai lầm tốn kém bằng cách yêu cầu các câu trả lời cụ thể:
- Bạn có thể truy xuất dữ liệu của một bệnh nhân duy nhất qua mọi hệ thống mà mô hình sẽ sử dụng không?
- Ai, đích danh là ai, chịu trách nhiệm duy trì chất lượng dữ liệu và giám sát hiệu suất mô hình?
- Các cảnh báo đã được kiểm thử với các bác sĩ lâm sàng trong một ca trực thực tế chưa, hay chỉ mới trong môi trường thử nghiệm (sandbox)?
- Có kế hoạch giám sát được văn bản hóa, trong đó quy định rõ cách xác định và xử lý sự sai lệch hiệu suất (performance drift) hay không?
Nếu nhà cung cấp không thể chỉ ra một con người, một quy trình hoặc một bảng điều khiển giám sát cụ thể, tổ chức nên tạm dừng và đánh giá lại.
Bài học rút ra
Mô hình dự đoán nhiễm trùng huyết của Epic không thất bại vì học máy không phù hợp với môi trường bệnh viện; nó thất bại vì thiếu các cấu trúc quản trị và đường ống dữ liệu (data pipeline) đi kèm. Một mô hình dự đoán chính quyết định của bác sĩ là lời cảnh báo rằng lớp kỹ thuật dữ liệu (data-engineering layer), chứ không phải thuật toán, mới là thứ cần được cải thiện. Việc xây dựng AI đáng tin cậy trong lĩnh vực chăm sóc sức khỏe đòi hỏi cùng một loại cơ sở hạ tầng "nhàm chán" vốn giúp duy trì mọi hệ thống IT quan trọng: dữ liệu sạch và được kết nối, trách nhiệm giải trình rõ ràng, các cảnh báo được tích hợp trực tiếp vào quy trình làm việc, và khả năng giám sát chủ động. Nếu thiếu những yếu tố đó, ngay cả mô hình tinh vi nhất cũng sẽ chỉ đưa ra những cảnh báo sai lệch cho sai đối tượng.
