Các nhà nghiên cứu tại MIT đã chỉ ra rằng các công cụ giải thích AI giúp tăng độ chính xác trong chẩn đoán đối với người dùng không chuyên nhưng lại gây cản trở cho các bác sĩ dày dạn kinh nghiệm, đe dọa đến sự an toàn của bệnh nhân và uy tín của việc triển khai AI trong y tế. Họ đã thử nghiệm một mô hình phân loại bệnh da liễu trên những người tham gia có nền tảng y khoa khác nhau và phát hiện ra một sự phân hóa rõ rệt: những người không có chuyên môn đã cải thiện được quyết định của mình, trong khi các bác sĩ chăm sóc ban đầu thường cảm thấy “ma sát nhận thức” (cognitive friction) khi lập luận của AI xung đột với lập luận của chính họ.

Nghiên cứu đảo lộn giả định “một kích cỡ cho tất cả”

Trí tuệ nhân tạo hiện đã hiện diện trong nhiều hệ thống thông tin bệnh viện, tuy nhiên hầu hết các nhà cung cấp đều cung cấp một giao diện giải thích duy nhất cho mọi người dùng. Nhóm nghiên cứu MIT đã yêu cầu những người tham gia chẩn đoán các tổn thương da, đầu tiên là tự thực hiện và sau đó là với một mô hình AI cung cấp các bản đồ nhiệt (heatmaps) trực quan và các lý lẽ bằng văn bản. Họ đã so sánh hai nhóm: những người có ít hoặc không có đào tạo y khoa và các bác sĩ chăm sóc ban đầu thực hiện chẩn đoán hàng ngày.

Kết quả cho thấy sự khác biệt. Những người tham gia không chuyên đã tăng vọt về độ chính xác sau khi xem kết quả của AI, nhưng phần lớn sự cải thiện này đến từ việc đơn thuần tin tưởng vào gợi ý của máy móc—một trường hợp điển hình của “định kiến tự động hóa” (automation bias). Tuy nhiên, các bác sĩ lâm sàng không nhận được sự cải thiện nhất quán. Khi các giải thích của AI quá đơn giản hoặc không phù hợp với lập luận lâm sàng, các bác sĩ cho biết họ cảm thấy bối rối, mất tập trung và trong một số trường hợp, sự tự tin trong chẩn đoán bị giảm sút.

“Định kiến tự động hóa” có ý nghĩa gì đối với người mới bắt đầu

Đối với những người không chuyên, điểm số tin cậy và các vùng được làm nổi bật của AI đóng vai trò như một lối tắt dẫn đến câu trả lời đúng. Nghiên cứu cho thấy những người dùng này tin tưởng mô hình ngay cả khi lời giải thích cung cấp rất ít thông tin chuyên sâu về bệnh lý nền tảng. Nguy cơ là kép: bệnh nhân nhận được sự chăm sóc dựa trên phán đoán của máy móc thay vì kỹ năng của một bác sĩ đang trong quá trình phát triển, và người dùng bỏ lỡ cơ hội học hỏi các dấu hiệu chẩn đoán mà AI đánh dấu.

Các nhà nghiên cứu cảnh báo rằng mặc dù độ chính xác cao hơn là một thắng lợi tức thời, nhưng cái giá phải trả về lâu dài có thể là một thế hệ bác sĩ lâm sàng phụ thuộc vào các khuyến nghị từ “hộp đen” mà không hiểu tại sao. Sự phụ thuộc này làm xói mòn tư duy phản biện, khiến việc phát hiện các lỗi của mô hình hoặc các trường hợp hiếm gặp nằm ngoài dữ liệu đào tạo trở nên khó khăn hơn.

Tại sao các bác sĩ dày dạn kinh nghiệm lại phản đối

Các bác sĩ mang theo một mô hình tư duy về bệnh tật bao gồm tiền sử bệnh nhân, dịch tễ học và các đặc điểm hình ảnh tinh vi. Khi giao diện AI chỉ cung cấp các bản tóm tắt ở mức độ cao hoặc các con số tin cậy chung chung, nó sẽ xung đột với mô hình đó. Thí nghiệm của MIT cho thấy các bác sĩ lâm sàng thường cần dữ liệu chi tiết hơn—như bản đồ phân bổ đặc trưng (feature attribution maps), các tài liệu tham khảo so sánh hoặc các phân phối xác suất chi tiết—để tích hợp lời khuyên của AI một cách có ý nghĩa.

Khi các lời giải thích không thỏa đáng, các bác sĩ báo cáo về tình trạng “ma sát nhận thức”, một sự kháng cự về mặt tinh thần làm chậm quá trình ra quyết định và làm tăng khả năng xảy ra sai sót. Trong chăm sóc ban đầu, sự ma sát đó dẫn đến việc tư vấn kéo dài hơn, giảm hiệu suất làm việc và có khả năng bỏ lỡ các chẩn đoán.

Thiết kế AI hiểu rõ đối tượng người dùng

Các tác giả ủng hộ phương pháp “giải thích dựa trên chân dung người dùng” (persona-based explainability), chuyển đổi từ các bảng điều khiển tĩnh sang các giao diện thích ứng, có khả năng điều chỉnh độ sâu và định dạng dựa trên chuyên môn của người dùng. Một cách triển khai thực tế có thể bao gồm hai lớp riêng biệt:

  • Lớp dành cho người không chuyên: một bản tóm tắt ngắn gọn, điểm số tin cậy và một dấu hiệu trực quan đơn giản (ví dụ: một bản đồ nhiệt) giúp trấn an người dùng mà không làm họ bị choáng ngợp.
  • Lớp dành cho chuyên gia: các bản đồ nhiệt chi tiết, đóng góp đặc trưng định lượng, các liên kết đến các nghiên cứu đã được bình duyệt và khả năng đi sâu vào các điểm không chắc chắn của mô hình.

Các nhà phát triển sẽ cần tích hợp một cơ chế phát hiện hồ sơ người dùng—có lẽ là một đăng nhập đơn giản với các thẻ vai trò—hoặc cho phép các bác sĩ chuyển đổi giữa các chế độ giải thích. Mục tiêu không phải là che giấu sự phức tạp đối với bác sĩ mà là trình bày nó khi nó mang lại giá trị, đồng thời giữ cho nó ở mức tối thiểu đối với những người chỉ cần sự hướng dẫn.

Các lập luận phản bác và rào cản thực tế

Một số nhà cung cấp AI cho rằng một giao diện thống nhất sẽ giúp giảm chi phí đào tạo và sự phức tạp về mặt quy định. Một định dạng giải thích duy nhất sẽ dễ dàng được chứng nhận và triển khai trên các hệ thống y tế khác nhau. Hơn nữa, các bác sĩ lâm sàng vốn đã đối mặt với tình trạng “mệt mỏi vì cảnh báo” (alert fatigue); việc thêm một lớp thông tin khác có thể bị coi là thêm sự nhiễu loạn.

Các phát hiện của MIT cho thấy cái giá của cách tiếp cận “một kích cỡ cho tất cả” có thể lớn hơn những hiệu quả ngắn hạn này. Nếu các bác sĩ lâm sàng từ chối hoặc sử dụng sai công cụ AI vì các lời giải thích của nó có vẻ không liên quan, việc áp dụng sẽ bị đình trệ, gây lãng phí đầu tư vào phát triển và tích hợp.

Điều cần theo dõi tiếp theo

Nghiên cứu chỉ ra một số hành động tức thời dành cho các bên liên quan trong lĩnh vực AI y tế:

  • Triển khai thí điểm các mô-đun giải thích thích ứng trong các công cụ chẩn đoán hiện có và đo lường tác động đến quy trình làm việc cũng như tỷ lệ sai sót.
  • Thu thập phản hồi liên tục từ những người dùng mới (ví dụ: sinh viên y khoa, nhân viên phân loại bệnh từ xa) và các bác sĩ lâm sàng giàu kinh nghiệm để tinh chỉnh logic về chân dung người dùng (persona).
  • Xây dựng các tiêu chuẩn về khả năng giải thích đa tầng có thể được đưa vào các hồ sơ trình lên cơ quan quản lý, đảm bảo các đánh giá an toàn có tính đến các rủi ro đặc thù của từng nhóm người dùng.
  • Giáo dục người dùng về định kiến tự động hóa (automation bias), nhấn mạnh rằng AI là một công cụ hỗ trợ ra quyết định, không phải là sự thay thế cho phán đoán lâm sàng.

Bài học rút ra

AI có thể nâng cao hiệu suất chẩn đoán, nhưng chỉ khi các giải thích của nó sử dụng ngôn ngữ phù hợp với người đang xem chúng. Việc phớt lờ khoảng cách về chuyên môn sẽ thúc đẩy sự phụ thuộc quá mức ở những người mới bắt đầu và tạo ra sự bất tiện cho các bác sĩ, gây nguy hiểm cho cả kết quả điều trị của bệnh nhân lẫn uy tín của AI y tế. Các giao diện thích ứng và nhận biết chân dung người dùng không còn là một tính năng "có thì tốt" nữa—chúng là điều kiện tiên quyết để tích hợp AI một cách an toàn và hiệu quả vào thực hành lâm sàng.