นักวิจัยจาก MIT แสดงให้เห็นว่าเครื่องมืออธิบายการทำงานของ AI (AI explainability tools) ช่วยเพิ่มความแม่นยำในการวินิจฉัยสำหรับผู้ใช้งานทั่วไป แต่กลับเป็นอุปสรรคต่อแพทย์ผู้เชี่ยวชาญ ซึ่งอาจส่งผลกระทบต่อความปลอดภัยของผู้ป่วยและความน่าเชื่อถือของการนำ AI มาใช้ในด้านสุขภาพ พวกเขาได้ทดสอบตัวจำแนกโรคผิวหนังกับผู้เข้าร่วมที่มีพื้นฐานทางการแพทย์ที่แตกต่างกัน และพบความแตกต่างอย่างชัดเจน: ผู้ที่ไม่ใช่ผู้เชี่ยวชาญสามารถตัดสินใจได้ดีขึ้น ในขณะที่แพทย์เวชปฏิบัติทั่วไปมักรู้สึกถึง "ความขัดแย้งทางพุทธิปัญญา" (cognitive friction) เมื่อเหตุผลของ AI ขัดแย้งกับความคิดของตนเอง

การศึกษาที่พลิกความเชื่อเรื่องแนวคิด “แบบเดียวใช้ได้กับทุกคน” (one-size-fits-all)

ปัจจุบันปัญญาประดิษฐ์ได้เข้ามาอยู่ในระบบสารสนเทศของโรงพยาบาลหลายแห่งแล้ว แต่ผู้ให้บริการส่วนใหญ่กลับส่งมอบอินเทอร์เฟซการอธิบายรูปแบบเดียวให้กับผู้ใช้ทุกคน ทีมวิจัยจาก MIT ให้ผู้เข้าร่วมวินิจฉัยรอยโรคผิวหนัง โดยเริ่มจากการวินิจฉัยด้วยตนเองก่อน แล้วจึงใช้โมเดล AI ที่ให้ทั้งแผนภูมิความร้อน (heatmaps) เชิงภาพและเหตุผลประกอบในรูปแบบข้อความ พวกเขาเปรียบเทียบผู้เข้าร่วมสองกลุ่ม ได้แก่ ผู้ที่มีความรู้ทางการแพทย์น้อยหรือไม่เคยมีเลย กับแพทย์เวชปฏิบัติทั่วไปที่ทำการวินิจฉัยเป็นประจำทุกวัน

ผลลัพธ์ที่ได้นั้นแตกต่างกันอย่างสิ้นเชิง ผู้เข้าร่วมที่เป็นบุคคลทั่วไปมีความแม่นยำเพิ่มขึ้นอย่างมากหลังจากเห็นผลลัพธ์จาก AI แต่ความแม่นยำที่เพิ่มขึ้นส่วนใหญ่มาจากการยอมรับคำแนะนำของเครื่องจักรโดยง่าย ซึ่งเป็นกรณีคลาสสิกของ "อคติจากการเชื่อมั่นในระบบอัตโนมัติ" (automation bias) อย่างไรก็ตาม แพทย์กลับไม่ได้รับประโยชน์จากการเพิ่มความแม่นยำที่สม่ำเสมอ เมื่อคำอธิบายของ AI นั้นเรียบง่ายเกินไปหรือไม่สอดคล้องกับหลักการวินิจฉัยทางคลินิก แพทย์รายงานว่าเกิดความสับสน เสียสมาธิ และในบางกรณี ความมั่นใจในการวินิจฉัยก็ลดลงด้วย

“อคติจากการเชื่อมั่นในระบบอัตโนมัติ” หมายถึงอะไรสำหรับมือใหม่

สำหรับผู้ที่ไม่ใช่ผู้เชี่ยวชาญ คะแนนความเชื่อมั่น (confidence scores) และบริเวณที่ AI ไฮไลต์ไว้ ทำหน้าที่เป็นทางลัดไปสู่คำตอบที่ถูกต้อง การศึกษาพบว่าผู้ใช้เหล่านี้เชื่อถือโมเดลแม้ว่าคำอธิบายจะให้ข้อมูลเชิงลึกเกี่ยวกับพยาธิสภาพ (pathology) ที่เป็นต้นเหตุเพียงเล็กน้อยก็ตาม ความอันตรายนี้มีสองด้าน: ประการแรก ผู้ป่วยได้รับการดูแลโดยอิงจากการตัดสินใจของเครื่องจักรแทนที่จะเป็นทักษะของแพทย์ที่กำลังพัฒนา และประการที่สอง ผู้ใช้พลาดโอกาสในการเรียนรู้สัญญาณบ่งชี้การวินิจฉัยที่ AI ระบุไว้

นักวิจัยเตือนว่าแม้ความแม่นยำที่สูงขึ้นจะเป็นผลดีในระยะสั้น แต่ต้นทุนในระยะยาวอาจเป็นการสร้างบุคลากรทางการแพทย์รุ่นใหม่ที่พึ่งพาคำแนะนำจาก "กล่องดำ" (black-box) โดยไม่เข้าใจเหตุผลเบื้องหลัง ความพึ่งพานี้จะบั่นทอนการคิดเชิงวิพากษ์ ทำให้ยากต่อการตรวจพบข้อผิดพลาดของโมเดลหรือกรณีที่พบได้ยากซึ่งอยู่นอกเหนือข้อมูลที่ใช้ฝึกสอน

ทำไมแพทย์ผู้เชี่ยวชาญจึงต่อต้าน

แพทย์มีแบบจำลองทางความคิด (mental model) เกี่ยวกับโรค ซึ่งรวมถึงประวัติผู้ป่วย ระบาดวิทยา และรูปแบบทางภาพที่มีความละเอียดอ่อน เมื่ออินเทอร์เฟซของ AI ให้เพียงบทสรุปในระดับสูงหรือตัวเลขความเชื่อมั่นแบบทั่วไป มันจึงขัดแย้งกับแบบจำลองดังกล่าว การทดลองของ MIT แสดงให้เห็นว่าแพทย์มักต้องการข้อมูลที่มีความละเอียดมากกว่านี้ เช่น แผนที่การระบุคุณลักษณะ (feature attribution maps) การอ้างอิงวรรณกรรมเปรียบเทียบ หรือการกระจายความน่าจะเป็นที่ละเอียด เพื่อที่จะนำคำแนะนำของ AI ไปปรับใช้ได้อย่างมีความหมาย

เมื่อคำอธิบายไม่เพียงพอ แพทย์รายงานว่าเกิด “ความขัดแย้งทางพุทธิปัญญา” (cognitive friction) ซึ่งเป็นแรงต้านทางความคิดที่ทำให้การตัดสินใจช้าลงและเพิ่มโอกาสในการเกิดข้อผิดพลาด ในการดูแลสุขภาพระดับปฐมภูมิ ความขัดแย้งนี้ส่งผลให้การปรึกษาใช้เวลานานขึ้น ประสิทธิภาพในการตรวจผู้ป่วยลดลง และอาจนำไปสู่การวินิจฉัยที่ผิดพลาดได้

การออกแบบ AI ที่รู้จักกลุ่มเป้าหมายของตน

ผู้เขียนเสนอให้ใช้ “การอธิบายตามลักษณะบุคคล” (persona-based explainability) โดยเปลี่ยนจากแดชบอร์ดแบบคงที่ไปเป็นอินเทอร์เฟซที่ปรับเปลี่ยนได้ ซึ่งจะปรับความลึกและรูปแบบตามความเชี่ยวชาญของผู้ใช้ การนำไปใช้จริงอาจแบ่งออกเป็นสองระดับที่แตกต่างกัน:

  • ระดับบุคคลทั่วไป (Layperson layer): บทสรุปที่กระชับ คะแนนความเชื่อมั่น และสัญญาณภาพที่เข้าใจง่าย (เช่น แผนภูมิความร้อน) เพื่อให้ความมั่นใจแก่ผู้ใช้โดยไม่ทำให้รู้สึกหนักเกินไป
  • ระดับมืออาชีพ (Professional layer): แผนภูมิความร้อนที่ละเอียด การระบุส่วนร่วมของคุณลักษณะเชิงปริมาณ ลิงก์ไปยังการศึกษาที่ผ่านการพิจารณาโดยผู้เชี่ยวชาญ (peer-reviewed studies) และความสามารถในการเจาะลึกถึงความไม่แน่นอนของโมเดล

นักพัฒนาจำเป็นต้องฝังกลไกการตรวจจับโปรไฟล์ผู้ใช้ เช่น การเข้าสู่ระบบง่ายๆ พร้อมการระบุบทบาท หรือให้แพทย์สามารถสลับโหมดการอธิบายได้ เป้าหมายไม่ใช่การปิดบังความซับซ้อนจากแพทย์ แต่เป็นการนำเสนอความซับซ้อนเมื่อมันสร้างมูลค่า ในขณะที่ยังคงความเรียบง่ายสำหรับผู้ที่ต้องการเพียงคำแนะนำเท่านั้น

ข้อโต้แย้งและอุปสรรคในทางปฏิบัติ

ผู้ให้บริการ AI บางรายอ้างว่าอินเทอร์เฟซที่เป็นรูปแบบเดียวกันช่วยลดต้นทุนการฝึกอบรมและความซับซ้อนด้านกฎระเบียบ รูปแบบการอธิบายเพียงรูปแบบเดียวทำให้การรับรองและการนำไปใช้ในระบบสุขภาพที่แตกต่างกันทำได้ง่ายกว่า นอกจากนี้ แพทย์ยังต้องเผชิญกับภาวะล้าจากการแจ้งเตือน (alert fatigue) อยู่แล้ว การเพิ่มข้อมูลอีกชั้นหนึ่งอาจถูกมองว่าเป็นเพียง "เสียงรบกวน" (noise) ที่เพิ่มขึ้นมา

ผลการศึกษาของ MIT ชี้ให้เห็นว่าต้นทุนของแนวทาง “แบบเดียวใช้ได้กับทุกคน” อาจมีมูลค่าสูงกว่าประสิทธิภาพในระยะสั้นเหล่านี้ หากแพทย์ปฏิเสธหรือไม่ใช้เครื่องมือ AI อย่างถูกต้องเนื่องจากคำอธิบายดูไม่เกี่ยวข้อง การนำไปใช้งานจริงก็จะหยุดชะงัก ซึ่งเป็นการสิ้นเปลืองเงินลงทุนในการพัฒนาและการบูรณาการระบบ

สิ่งที่ต้องจับตามองต่อไป

ผลการศึกษานี้ชี้ให้เห็นถึงแนวทางปฏิบัติเร่งด่วนหลายประการสำหรับผู้มีส่วนได้ส่วนเสียในด้าน Health-AI:

  • ทดลองใช้โมดูลการอธิบายแบบปรับเปลี่ยนได้ (adaptive explanation modules) ในเครื่องมือวินิจฉัยที่มีอยู่ และวัดผลกระทบต่อกระบวนการทำงานและอัตราความผิดพลาด
  • รวบรวมข้อเสนอแนะอย่างต่อเนื่อง จากผู้ใช้งานมือใหม่ (เช่น นักศึกษาแพทย์, เจ้าหน้าที่คัดกรองทางไกล) และบุคลากรทางการแพทย์ที่มีประสบการณ์ เพื่อนำมาปรับปรุงตรรกะด้านบุคลิกภาพ (persona logic)
  • พัฒนามาตรฐาน สำหรับความสามารถในการอธิบายแบบหลายระดับ (multi-tiered explainability) ที่สามารถนำไปรวมไว้ในการยื่นขอรับรองจากหน่วยงานกำกับดูแล เพื่อให้มั่นใจว่าการประเมินความปลอดภัยได้คำนึงถึงความเสี่ยงเฉพาะของผู้ใช้งานแต่ละกลุ่ม
  • ให้ความรู้แก่ผู้ใช้งาน เกี่ยวกับอคติจากการเชื่อมั่นในระบบอัตโนมัติ (automation bias) โดยเน้นย้ำว่า AI เป็นเพียงเครื่องมือช่วยตัดสินใจ ไม่ใช่สิ่งที่จะมาทดแทนการตัดสินใจทางคลินิก

บทสรุป

AI สามารถยกระดับประสิทธิภาพการวินิจฉัยได้ แต่ต้องเป็นการอธิบายที่สื่อสารด้วยภาษาที่เหมาะสมกับผู้ใช้งานแต่ละคนเท่านั้น การละเลยช่องว่างด้านความเชี่ยวชาญจะกระตุ้นให้เกิดการพึ่งพาเทคโนโลยีมากเกินไปในกลุ่มผู้ใช้งานมือใหม่ และสร้างความติดขัดในการทำงานของแพทย์ ซึ่งจะส่งผลเสียต่อทั้งผลลัพธ์การรักษาผู้ป่วยและความน่าเชื่อถือของ Health-AI อินเทอร์เฟซที่สามารถปรับเปลี่ยนได้และคำนึงถึงลักษณะเฉพาะของผู้ใช้ (persona-aware) ไม่ใช่เพียงฟีเจอร์ที่มีก็ดีไม่มีก็ได้อีกต่อไป แต่เป็นเงื่อนไขสำคัญสำหรับการบูรณาการ AI เข้ากับการปฏิบัติงานทางคลินิกอย่างปลอดภัยและมีประสิทธิภาพ