PRISM2 ใช้บทสนทนาทางคลินิกเพื่อปฏิวัติ AI ทางพยาธิวิทยาได้อย่างไร
ความร่วมมือครั้งสำคัญระหว่าง Paige และ Microsoft ได้เปิดตัว PRISM2 ซึ่งเป็นโมเดล AI แบบ multimodal ที่ออกแบบมาเพื่อเชื่อมช่องว่างระหว่างพยาธิวิทยาเชิงภาพ (visual pathology) และการให้เหตุผลทางคลินิก (clinical reasoning) ด้วยการบูรณาการภาพสไลด์ทั้งแผ่น (whole-slide imaging) เข้ากับความละเอียดอ่อนของบทสนทนาทางการแพทย์ โมเดลนี้จึงก้าวข้ามการจดจำรูปแบบแบบธรรมดา ไปสู่การตีความเพื่อการวินิจฉัยที่แท้จริง
ก้าวข้ามการจำแนกประเภทด้วยพิกเซล
AI แบบดั้งเดิมในด้านพยาธิวิทยาดิจิทัลส่วนใหญ่มักมุ่งเน้นไปที่งานการเรียนรู้แบบมีผู้สอน (supervised learning) เช่น การจำแนกพิกเซลเฉพาะจุดหรือการระบุโครงสร้างของเซลล์ แม้ว่าจะมีประสิทธิภาพ แต่โมเดลเหล่านี้มักขาดความลึกซึ้งในเชิงบริบทที่จำเป็นสำหรับการตัดสินใจทางคลินิกที่ซับซ้อน PRISM2 เข้ามาเปลี่ยนกระบวนทัศน์นี้โดยการใช้ perceiver-based encoder ซึ่งประมวลผลภาพสไลด์ทั้งแผ่น (WSIs) ในรูปแบบที่แตกต่างไปจากเดิมอย่างสิ้นเชิง
แทนที่จะเป็นเพียงการติดป้ายกำกับภาพ PRISM2 ได้รับการฝึกฝนให้ตีความชิ้นส่วนเนื้อเยื่อ (tissue tiles) ผ่านมุมมองของบทสนทนาทางคลินิกที่สกัดมาจากรายงานทางพยาธิวิทยา สิ่งนี้ช่วยให้โมเดลไม่เพียงแต่เข้าใจว่าเซลล์มีลักษณะอย่างไร แต่ยังเข้าใจด้วยว่าการปรากฏของเซลล์นั้นมีความหมายอย่างไรภายใต้บริบททางคลินิกที่กว้างขึ้นของการวินิจฉัยผู้ป่วย
สถาปัตยกรรมทางเทคนิคและขนาดของการฝึกฝน
ความซับซ้อนทางเทคนิคของ PRISM2 อยู่ที่ความสามารถในการจัดการกับความหนาแน่นของข้อมูลมหาศาลที่มีอยู่ในงานพยาธิวิทยา ภาพสไลด์ทั้งแผ่นเพียงภาพเดียวประกอบด้วยข้อมูลจำนวนมหาศาล ซึ่งมักจะเกินขีดความสามารถของ vision transformers มาตรฐาน PRISM2 แก้ปัญหานี้โดยการรวบรวม tile embeddings จำนวนหลายพันรายการต่อหนึ่งสไลด์ให้กลายเป็นตัวแทนข้อมูล (representation) ชุดเดียวที่สอดประสานกัน
ขนาดของข้อมูลที่ใช้ฝึกฝนก็น่าประทับใจไม่แพ้กัน โมเดลนี้ได้รับการฝึกฝนด้วยชุดข้อมูลขนาดมหึมาที่ครอบคลุมภาพสไลด์ทั้งแผ่นถึง 2.3 ล้านภาพ ด้วยการฝึกฝนร่วมกันทั้งชิ้นส่วนภาพ (visual tiles) และข้อความทางคลินิกที่เกี่ยวข้อง โมเดลจึงเรียนรู้การจัดแนวแบบ multimodal (multimodal alignment) ที่ช่วยให้สามารถสร้างข้อความที่มนุษย์อ่านเข้าใจได้ แทนที่จะแสดงผลเพียงการจำแนกประเภทแบบสองทาง (binary classification) PRISM2 ยังสามารถตอบคำถามเฉพาะเจาะจงในการวินิจฉัยได้ ซึ่งเป็นการจำลองกระบวนการให้เหตุผลของพยาธิแพทย์ที่เป็นมนุษย์
ทำไมสิ่งนี้จึงสำคัญต่ออนาคตของ AI ในการดูแลสุขภาพ
การเกิดขึ้นของ PRISM2 ส่งสัญญาณถึงการเปลี่ยนแปลงในภูมิทัศน์ของ AI จาก "discriminative AI" (ที่ทำหน้าที่จำแนกประเภท) ไปสู่ "generative reasoning AI" (ที่ทำหน้าที่อธิบายเหตุผล) สำหรับนักพัฒนาและผู้ก่อตั้งในแวดวง MedTech นี่คือการก้าวไปสู่เครื่องมือทางคลินิกที่มีความโปร่งใสและมีประโยชน์มากขึ้น
เมื่อ AI สามารถสื่อสารสิ่งที่ค้นพบผ่านบทสนทนาได้ มันจะกลายเป็นพันธมิตรในการทำงานร่วมกัน แทนที่จะเป็นเพียงเครื่องมือแบบ "black box" ความสามารถนี้มีความสำคัญอย่างยิ่งต่อการนำไปใช้ในทางคลินิก เนื่องจากพยาธิแพทย์ต้องการความสามารถในการอธิบายได้ (explainability) เพื่อที่จะเชื่อมั่นในข้อมูลเชิงลึกที่ขับเคลื่อนด้วย AI ด้วยการบูรณาการความละเอียดอ่อนทางภาษาที่พบในรายงานทางพยาธิวิทยา PRISM2 จึงได้สร้างมาตรฐานใหม่ว่าโมเดลแบบ multimodal จะสามารถนำไปประยุกต์ใช้ในโดเมนเฉพาะทางที่มีความสำคัญสูง เช่น โรคมะเร็งวิทยา (oncology) และการวินิจฉัยได้อย่างไร
สรุปประเด็นสำคัญ
- การบูรณาการแบบ Multimodal: PRISM2 ใช้ perceiver-based encoder เพื่อเชื่อมโยงชิ้นส่วนเนื้อเยื่อจากสไลด์ทั้งแผ่นเข้ากับบทสนทนาทางคลินิกจากรายงานทางพยาธิวิทยา
- ขนาดที่มหาศาล: โมเดลนี้ได้รับการพัฒนาโดยใช้ชุดข้อมูลฝึกฝนขนาดใหญ่ถึง 2.3 ล้านภาพสไลด์ทั้งแผ่น เพื่อให้มั่นใจในการสกัดคุณลักษณะ (feature extraction) ที่แข็งแกร่ง
- การให้เหตุผลเหนือกว่าการจำแนกประเภท: ต่างจากโมเดลแบบดั้งเดิมที่จำแนกเพียงพิกเซล PRISM2 สามารถสร้างข้อความเพื่อตอบคำถามในการวินิจฉัยที่ซับซ้อนได้
บทความ: Microsoft และ Paige ได้เปิดตัว PRISM2 ซึ่งเป็นโมเดล AI แบบ multimodal ที่สามารถประมวลผลภาพพยาธิวิทยาแบบสไลด์ทั้งแผ่นได้ถึง 2.3 ล้านภาพ และสามารถตอบคำถามในการวินิจฉัยด้วยภาษาธรรมชาติ ด้วยการจับคู่การวิเคราะห์เชิงภาพเข้ากับบทสนทนาทางคลินิกที่พบในรายงานทางพยาธิวิทยา ระบบนี้สัญญาว่าจะเปลี่ยนผ่าน AI ในงานพยาธิวิทยาจากการจำแนกภาพเพียงอย่างเดียว ไปสู่การให้เหตุผลที่สะท้อนถึงกระบวนการคิดของพยาธิแพทย์ที่เป็นมนุษย์
จากพิกเซลสู่การให้เหตุผล
พยาธิวิทยาดิจิทัลพึ่งพา AI ที่มองสไลด์เป็นเพียงตารางพิกเซลที่ต้องติดป้ายกำกับมาอย่างยาวนาน โมเดลดังกล่าวมีความเชี่ยวชาญในงานอย่างเช่นการนับ mitosis หรือการระบุเซลล์นิวเคลียสที่ผิดปกติ แต่ยังไปไม่ถึงขั้นการอธิบายว่าสิ่งที่พบนั้นมีความสำคัญอย่างไรต่อภาพรวมของผู้ป่วย PRISM2 จะเข้ามาเปลี่ยนสิ่งนั้น หัวใจสำคัญของมันคือ perceiver-based encoder ซึ่งเป็นโครงข่ายประสาทเทียมประเภทหนึ่งที่สามารถบีบอัดชิ้นส่วนภาพ (image tiles) นับพันชิ้นให้กลายเป็นตัวแทนข้อมูล (representation) มิติสูงเพียงชุดเดียว จากนั้นตัวแทนข้อมูลดังกล่าวจะถูกจัดแนวให้สอดคล้องกับข้อความที่สกัดมาจากรายงานทางพยาธิวิทยาที่เกี่ยวข้อง ซึ่งเป็นการสอนให้โมเดลเชื่อมโยงรูปแบบทางภาพเข้ากับภาษาที่แพทย์ใช้ในการอธิบายสิ่งเหล่านั้น
ผลลัพธ์ที่ได้คือ AI ที่สามารถทำได้มากกว่าแค่การพูดว่า “บริเวณนี้เป็นเนื้อร้าย” แต่มันสามารถสร้างประโยคเช่น “การปรากฏของโครงสร้างต่อมที่ผิดปกติ ร่วมกับปฏิกิริยาของสโตรมา (stromal reaction) ที่สังเกตได้ บ่งชี้ว่าเป็นมะเร็งชนิดอะดีโนคาร์ซิโนมาที่มีการแบ่งตัวในระดับปานกลาง (moderately differentiated adenocarcinoma) ซึ่งสอดคล้องกับประวัติทางคลินิกของมะเร็งลำไส้ใหญ่และทวารหนัก” กล่าวอีกนัยหนึ่งคือ PRISM2 สามารถอธิบายเหตุผลเบื้องหลังการวินิจฉัยได้ ไม่ใช่แค่การระบุป้ายกำกับเพียงอย่างเดียว
ขนาดที่สร้างความแตกต่าง
การฝึกฝนโมเดลด้วยภาพสไลด์ทั้งแผ่น (whole-slide images) เป็นกระบวนการที่ต้องใช้ข้อมูลมหาศาล สไลด์เพียงแผ่นเดียวอาจมีพิกเซลนับพันล้านพิกเซล ซึ่งเกินขีดความสามารถของ vision transformers มาตรฐานที่เป็นหัวใจสำคัญของระบบ AI ด้านภาพจำนวนมาก PRISM2 หลีกเลี่ยงข้อจำกัดนี้โดยการแบ่งสไลด์แต่ละแผ่นออกเป็นแผ่นย่อย (tiles) ที่จัดการได้ ทำการฝังตัว (embedding) แต่ละแผ่นย่อย จากนั้นจึงรวบรวมการฝังตัวเหล่านั้นเข้าเป็นเวกเตอร์ในระดับสไลด์ แนวทางนี้ช่วยรักษาความละเอียดของข้อมูลในระดับเล็กน้อยไว้ได้ ในขณะที่ยังคงความต้องการด้านการคำนวณให้อยู่ในระดับที่จัดการได้
ความร่วมมือในครั้งนี้ได้ใช้ประโยชน์จากชุดข้อมูลภาพสไลด์ทั้งแผ่นจำนวน 2.3 ล้านภาพ ซึ่งเป็นหนึ่งในคอลเลกชันที่ใหญ่ที่สุดเท่าที่เคยมีการรวบรวมมาสำหรับ AI ทางพยาธิวิทยา แต่ละภาพจะถูกจับคู่กับคำบรรยายที่เป็นข้อความซึ่งพยาธิแพทย์เขียนขึ้นหลังจากตรวจสอบสไลด์ การฝึกฝนด้วยข้อมูลทั้งสองรูปแบบพร้อมกันทำให้ PRISM2 เรียนรู้ที่จะเชื่อมโยงสัญญาณทางภาพเข้ากับภาษาของการวินิจฉัย ทำให้สามารถสร้างคำตอบที่สอดคล้องกับคำถาม เช่น “ตำแหน่งปฐมภูมิที่น่าจะเป็นไปได้มากที่สุดคือที่ใด?” หรือ “เนื้อเยื่อแสดงหลักฐานของการลุกลามเข้าสู่หลอดเลือดและท่อน้ำเหลือง (lymphovascular invasion) หรือไม่?”
ทำไมสิ่งนี้ถึงอาจเปลี่ยนแนวทางการปฏิบัติทางคลินิก
พยาธิแพทย์คือผู้ดูแลหลักในการวินิจฉัยโรคมะเร็ง แต่ปริมาณสไลด์ที่พวกเขาต้องตรวจสอบนั้นเพิ่มขึ้นเร็วกว่าจำนวนบุคลากรที่จะรองรับได้ AI ที่ทำเพียงแค่ระบุบริเวณที่น่าสงสัยนั้นช่วยได้ในระดับหนึ่ง แต่บ่อยครั้งก็ทำให้แพทย์ไม่ทราบถึงพื้นฐานของการระบุนั้น ความสามารถของ PRISM2 ในการอธิบายสิ่งที่ค้นพบอาจช่วยเร่งความเชื่อมั่นและการนำไปใช้งานจริง เมื่ออัลกอริทึมกล่าวว่า “ฉันเห็นเนื้องอกชนิดรุนแรงสูง (high-grade tumor) เนื่องจากลักษณะทางสถาปัตยกรรมที่เฉพาะเจาะจงเหล่านี้” พยาธิแพทย์จะสามารถตรวจสอบ โต้แย้ง หรือต่อยอดจากเหตุผลนั้นได้ แทนที่จะปฏิบัติกับผลลัพธ์เหมือนเป็นคำตัดสินที่คลุมเครือ
สำหรับสตาร์ทอัพด้าน MedTech และทีม AI ของระบบสุขภาพขนาดใหญ่ โมเดลนี้ได้สร้างมาตรฐานใหม่ มันแสดงให้เห็นว่าการฝึกฝนแบบ multimodal ซึ่งเป็นการผสมผสานระหว่างรูปภาพและภาษาเฉพาะทาง สามารถสร้างเครื่องมือที่มีทั้งความแม่นยำและสามารถตีความได้ การผสมผสานนี้มีคุณค่าอย่างยิ่งในด้านมะเร็งวิทยา ซึ่งการตัดสินใจในการรักษาขึ้นอยู่กับการแบ่งประเภทย่อยทางพยาธิวิทยาที่มีความละเอียดอ่อน
อุปสรรคและข้อโต้แย้ง
คำมั่นสัญญาของการสนทนาเพื่อการวินิจฉัยไม่ได้ช่วยลบเลือนความท้าทายที่ยังคงอยู่ ประการแรก ประสิทธิภาพของโมเดลได้รับการรายงานในสภาพแวดล้อมการวิจัยเท่านั้น การตรวจสอบในโลกความเป็นจริงผ่านกระบวนการทำงานในห้องแล็บที่หลากหลาย ระเบียบวิธีการย้อมสี และผู้ผลิตเครื่องสแกนที่แตกต่างกันยังคงอยู่ในระหว่างดำเนินการ ระบบที่ทำงานได้ดีในชุดข้อมูลที่คัดสรรมาอย่างดีอาจประสบปัญหาเมื่อต้องเผชิญกับความผันแปรของการปฏิบัติงานในชีวิตประจำวัน
ประการที่สอง ข้อมูลที่ใช้ในการฝึกฝน ซึ่งประกอบด้วยสไลด์ 2.3 ล้านแผ่นและรายงานของสไลด์เหล่านั้น มีแนวโน้มว่าจะมาจากสถาบันจำนวนจำกัด หากกลุ่มตัวอย่างพื้นฐานไม่สะท้อนถึงความหลากหลายของประชากรผู้ป่วย โมเดลอาจรับอคติ (bias) มา ซึ่งอาจนำไปสู่การจำแนกประเภทลักษณะของโรคที่พบได้น้อยในกลุ่มตัวอย่างผิดพลาด
ประการที่สาม แนวทางการกำกับดูแลสำหรับ AI ที่สร้างผลลัพธ์ในรูปแบบการบรรยายนั้นยังไม่ชัดเจนเท่ากับตัวจำแนกประเภทแบบ binary หน่วยงานกำกับดูแลจำเป็นต้องประเมินไม่เพียงแค่ความแม่นยำเท่านั้น แต่ยังต้องประเมินความปลอดภัยของคำอธิบายที่ผิดพลาด ซึ่งอาจทำให้แพทย์เข้าใจผิดได้หากไม่มีการแจ้งเตือนอย่างเหมาะสม
สุดท้าย ต้นทุนการคำนวณในการรัน perceiver-based encoder บนข้อมูลสไลด์ทั้งแผ่นนั้นไม่ใช่เรื่องเล็กน้อย โรงพยาบาลจำเป็นต้องมีโครงสร้างพื้นฐาน GPU ที่เพียงพอหรือสัญญาการใช้ระบบคลาวด์ ซึ่งนำไปสู่คำถามเกี่ยวกับความคุ้มค่า โดยเฉพาะสำหรับห้องปฏิบัติการพยาธิวิทยาขนาดเล็ก
สิ่งที่ต้องจับตามองต่อไป
- การทดลองทางคลินิก: หลักฐานจากการศึกษาเชิงรุกที่เปรียบเทียบการวินิจฉัยโดยมี PRISM2 ช่วยเหลือกับการปฏิบัติงานมาตรฐาน จะเป็นปัจจัยตัดสินสำหรับการอนุมัติจากหน่วยงานกำกับดูแลและการนำไปใช้งาน
- กระบวนการบูรณาการระบบ: ความง่ายในการเชื่อมต่อโมเดลเข้ากับแพลตฟอร์มพยาธิวิทยาดิจิทัลที่มีอยู่เดิมจะส่งผลต่อความเร็วในการขยายการใช้งาน การเข้าถึง API ที่ราบรื่นและความเข้ากันได้กับซอฟต์แวร์ดูสไลด์ทั่วไปเป็นสิ่งจำเป็น
- ตัวชี้วัดความสามารถในการอธิบาย: เกณฑ์มาตรฐานที่เป็นอิสระซึ่งวัดว่าการสนทนาที่สร้างขึ้นสอดคล้องกับเหตุผลของผู้เชี่ยวชาญเพียงใด จะช่วยตอบข้อกังวลเรื่อง "กล่องดำ" (black-box)
- การกำหนดราคาและใบอนุญาต: โมเดลธุรกิจของความร่วมมือนี้ ไม่ว่าจะเป็นการเสนอเทคโนโลยีในรูปแบบการสมัครสมาชิก ค่าธรรมเนียมต่อสไลด์ หรือโซลูชันแบบติดตั้งในพื้นที่ (on-premise) จะส่งผลต่อสถาบันที่สามารถเข้าถึงเทคโนโลยีนี้ได้
บทสรุป
PRISM2 แสดงให้เห็นว่า AI สามารถก้าวข้ามจากการเป็นเพียงเครื่องมือระบุประเภทของเซลล์ ไปสู่การถ่ายทอดเรื่องราวทางคลินิกที่เซลล์เหล่านั้นบอกเล่าได้ ด้วยการฝึกฝนจากคลังภาพสไลด์ทั้งแผ่น (whole-slide images) จำนวนมหาศาล ควบคู่ไปกับภาษาที่พยาธิแพทย์ใช้ในชีวิตประจำวัน Microsoft และ Paige จึงได้สร้างระบบที่สามารถตอบคำถามในการวินิจฉัยได้อย่างเป็นธรรมชาติเหมือนการสนทนา หากโมเดลนี้พิสูจน์ได้ว่ามีความน่าเชื่อถือในสภาพความเป็นจริงที่ซับซ้อนของห้องปฏิบัติการในแต่ละวัน มันอาจทำให้ AI กลายเป็นผู้ร่วมงานที่แท้จริง แทนที่จะเป็นเพียงเครื่องตรวจจับที่ทำงานเงียบๆ ซึ่งจะช่วยปรับเปลี่ยนรูปแบบที่พยาธิวิทยาจะนำมาใช้ในการดูแลผู้ป่วย
