รัฐบาลกลางแทบจะไม่รีบร้อนนำเทคโนโลยีที่ยังไม่ผ่านการทดสอบมาใช้ โดยเฉพาะหน่วยงานด้านสาธารณสุขที่อาจใช้เวลาหลายปีกว่าที่จะตรวจสอบความถูกต้องของเครื่องมือใดเครื่องมือหนึ่งก่อนจะนำไปใช้กับบันทึกของผู้ป่วยหรือข้อมูลการระบาด ดังนั้น เมื่อหน่วยงานด้านสาธารณสุขของสหรัฐฯ ประกาศว่าจะเริ่มการทดสอบจริงด้วยระบบ Generative AI ที่สร้างโดย OpenAI และ Anthropic สัญญาณที่ส่งออกมาจึงชัดเจนว่า โมเดลภาษาขนาดใหญ่ (Large Language Models) ได้เปลี่ยนผ่านจากการเป็นเพียงการทดลองของผู้บริโภคไปสู่การเป็นตัวเลือกที่สำคัญสำหรับองค์กรระดับสถาบันแล้ว

สิ่งที่ PULSE ทำจริงๆ คืออะไร

ความพยายามครั้งใหม่นี้มีชื่อว่า Public Health Use Case and Learning Scaling Engine หรือเรียกสั้นๆ ว่า PULSE ซึ่งเป็นกรอบการทำงานเพื่อการทดสอบ ไม่ใช่การเปิดตัวผลิตภัณฑ์ แทนที่จะนำแชทบอทไปใส่ในระบบอีเมลของหน่วยงานสาธารณสุขแล้วหวังว่าทุกอย่างจะราบรื่น PULSE กลับปฏิบัติต่อ Generative AI ในลักษณะเดียวกับที่สาธารณสุขปฏิบัติต่อวัคซีนชนิดใหม่ โดยการสร้างสภาวะที่ควบคุมได้เพื่อให้หน่วยงานระดับรัฐ ท้องถิ่น ชนเผ่า และดินแดนต่างๆ สามารถทดลองใช้เครื่องมือเหล่านี้ พร้อมกับเฝ้าระวังผลข้างเคียงอย่างเข้มงวด

โครงการนี้เป็นการรวมตัวกันของพันธมิตรสี่ฝ่ายที่แตกต่างกัน โดย Coalition for Health AI (CHAI) จะเป็นผู้จัดหามาตรฐานด้านการกำกับดูแลและความปลอดภัยที่เฉพาะเจาะจงสำหรับด้านสุขภาพ OpenAI และ Anthropic จะสนับสนุนโมเดลภาษาล้ำสมัย (frontier language models) ส่วน Accenture จะให้ความเชี่ยวชาญด้านการบูรณาการที่จำเป็นในการเชื่อมต่อระบบเหล่านี้เข้ากับโครงสร้างพื้นฐานเดิมของรัฐบาล ซึ่งมักจะทำงานบนฐานข้อมูลที่มีอายุหลายทศวรรษและกฎระเบียบการจัดซื้อจัดจ้างที่เข้มงวด

PULSE ไม่ได้ตั้งคำถามว่า AI สามารถเขียนอีเมลหรือสรุปบันทึกการประชุมได้หรือไม่ แต่กำลังตั้งคำถามว่าโมเดลเหล่านี้จะสามารถช่วยงานหลักสามประการได้อย่างน่าเชื่อถือหรือไม่ ได้แก่: การเฝ้าระวังทางระบาดวิทยา (epidemiological surveillance), การจัดสรรทรัพยากร (resource allocation) และการสื่อสารด้านสาธารณสุข (public health communication) แม้ว่าแต่ละอย่างจะฟังดูเป็นนามธรรม แต่เมื่อรวมกันแล้ว สิ่งเหล่านี้คือภาระงานประจำวันในการบริหารหน่วยงานสาธารณสุข การเฝ้าระวังหมายถึงการคัดกรองรายงานจากห้องแล็บ การเข้ารับการรักษาในโรงพยาบาล และข้อมูลการขาดเรียนของนักเรียน เพื่อตรวจหาการระบาดก่อนที่จะขยายวงกว้าง การจัดสรรทรัพยากรหมายถึงการตัดสินใจแบบเรียลไทม์ว่าจะส่งโดสวัคซีนหรือยารักษาไวรัสที่มีอยู่อย่างจำกัดไปที่ใดในช่วงที่มีไข้หวัดใหญ่ระบาดหนัก ส่วนการสื่อสารด้านสาธารณสุขหมายถึงการแปลคำแนะนำที่ซับซ้อนจากรัฐบาลกลางให้เป็นภาษาที่เข้าใจง่ายสำหรับชุมชนที่หลากหลาย ซึ่งมักจะต้องทำแข่งกับเวลาในระหว่างการสืบสวนโรคที่เกิดจากอาหาร หาก AI สามารถช่วยงานเหล่านี้ได้โดยไม่สร้างภาระงานเพิ่มหรือทำให้เกิดข้อผิดพลาด ประสิทธิภาพที่ได้รับก็จะมหาศาล

ทำไมการทดสอบในสิบเขตอำนาจการปกครองถึงเปลี่ยนทุกอย่าง

โครงการนี้จะดำเนินการทดสอบในสิบเขตอำนาจการปกครอง ซึ่งคัดเลือกมาจากทั้งระดับรัฐ ท้องถิ่น ชนเผ่า และดินแดนของสหรัฐฯ การกระจายตัวอย่างตั้งใจนี้คือหัวใจสำคัญ หน่วยงานสาธารณสุขระดับรัฐในภูมิภาคที่มีประชากรหนาแน่น ซึ่งมีนักระบาดวิทยาหลายร้อยคนและมีเครือข่ายใยแก้วนำแสง ย่อมเผชิญกับข้อจำกัดที่แตกต่างอย่างสิ้นเชิงจากหน่วยงานในดินแดนที่ต้องติดตามโรคไข้เลือดออกด้วยเจ้าหน้าที่เพียงไม่กี่คนและมีการเชื่อมต่ออินเทอร์เน็ตที่ไม่สม่ำเสมอ

การรวมกลุ่มชนเผ่าเข้าไว้ด้วยกันมีความสำคัญเป็นพิเศษ เนื่องจากหน่วยงานด้านสาธารณสุขของชนเผ่าเผชิญกับปัญหาการขาดแคลนงบประมาณเรื้อรังและความกังวลเรื่องอธิปไตยของข้อมูล (data sovereignty) มาโดยตลอด การรวมเขตอำนาจของชนเผ่าเข้าไว้ในโครงการ ทำให้ PULSE ตระหนักว่าเครื่องมือ AI ใดๆ ที่อ้างว่ามีประโยชน์ในระดับชาติ จะต้องสามารถจัดการกับประชากรเฉพาะกลุ่ม เคารพโครงสร้างการปกครองที่แตกต่าง และทำงานได้ในสภาพแวดล้อมที่มีภาระทางสุขภาพทางสังคมและสิ่งแวดล้อมที่เป็นเอกลักษณ์ หากโมเดลไม่สามารถทำงานภายใต้เงื่อนไขเหล่านี้ได้ ก็ไม่สมควรได้รับการรับรองจากรัฐบาลกลาง

หน่วยงานในดินแดนต่างๆ ยังเป็นการทดสอบความทนทาน (stress test) ที่จำเป็นอีกประการหนึ่ง เจ้าหน้าที่สาธารณสุขในดินแดนของสหรัฐฯ ต้องจัดการกับรูปแบบของโรคและห่วงโซ่อุปทานที่แตกต่างอย่างมากจากแผ่นดินใหญ่ ผู้ช่วย AI ที่ตั้งสมมติฐานว่ามีการเชื่อมต่ออินเทอร์เน็ตที่สมบูรณ์แบบ หรือพึ่งพาพฤติกรรมการใช้รหัส ICD-10 ที่พบได้ทั่วไปในโรงพยาบาลขนาดใหญ่ในเมือง จะล้มเหลวทันทีเมื่อพายุเฮอริเคนทำลายโครงสร้างพื้นฐาน การออกแบบให้ครอบคลุมสิบเขตอำนาจการปกครองจึงบีบให้โครงการต้องเก็บหลักฐานที่ชัดเจนว่าโมเดลเหล่านี้สามารถปรับตัวเข้ากับสภาพแวดล้อมที่ไม่สมบูรณ์ได้ หรือจะพังทลายลงเมื่อเจออุปสรรค

จากแชทบอทสู่โครงสร้างพื้นฐานที่สำคัญต่อภารกิจ

ในช่วงสองปีที่ผ่านมา บทสนทนาสาธารณะเกี่ยวกับโมเดลภาษาขนาดใหญ่ได้มุ่งเน้นไปที่การเขียนโค้ดทางลัด การเขียนคำโฆษณา และการสร้างรูปภาพ แต่ PULSE จงใจเปลี่ยนจุดสนใจไปที่โครงสร้างพื้นฐานที่สำคัญต่อภารกิจ (mission-critical infrastructure) เมื่อหน่วยงานสาธารณสุขใช้โมเดล AI เพื่อวิเคราะห์รายงานโรคติดต่อ ความผิดพลาดจะไม่ใช่แค่ "อาการประสาทหลอน" (hallucination) ที่ดูแปลกประหลาด แต่มันคือความล้มเหลวที่อาจส่งผลต่อความปลอดภัยของสาธารณชน

ความจริงข้อนั้นทำให้โครงการนำร่องนี้กลายเป็นผู้สร้างบรรทัดฐานสำหรับปัญหาทางเทคนิคที่ยืดเยื้อสามประการ ได้แก่ ความแม่นยำ การลดการหลอนของโมเดล (hallucination mitigation) และความเป็นส่วนตัวของข้อมูล ในบริบทนี้ การหลอน (hallucination) อาจหมายถึงการที่โมเดลสร้างข้อมูลปฏิสัมพันธ์ระหว่างยาขึ้นมาเอง การกุเรื่องกลุ่มการระบาดที่ไม่มีอยู่จริง หรือการระบุข้อบังคับในการรายงานผิดพลาด PULSE ถูกออกแบบมาเพื่อวัดความถี่ในการเกิดข้อผิดพลาดเหล่านี้ และดูว่ามาตรการป้องกันทางเทคนิค (technical guardrails) จะสามารถตรวจจับข้อผิดพลาดเหล่านั้นได้ก่อนที่จะไปถึงผู้มีอำนาจตัดสินใจหรือไม่

เรื่องความเป็นส่วนตัวก็มีความสำคัญไม่แพ้กัน หน่วยงานสาธารณสุขต้องจัดการกับข้อมูลสุขภาพที่ได้รับการคุ้มครองภายใต้กฎหมาย HIPAA และข้อบังคับระดับรัฐเพิ่มเติม ระบบ AI ใดก็ตามที่สัมผัสกับข้อมูลนี้จะต้องแสดงให้เห็นอย่างชัดเจนว่ามีการจัดเก็บอะไรบ้าง ข้อมูลที่ใช้ฝึกฝนไหลเวียนไปที่ไหน และใครสามารถเข้าถึงผลลัพธ์ได้ในภายหลัง การเข้ามามีส่วนร่วมของ CHAI เป็นสัญญาณว่าการทดสอบเหล่านี้จะไม่ใช่แค่การทดสอบความฉลาดดิบๆ ของโมเดลจาก OpenAI และ Anthropic เท่านั้น แต่ยังรวมถึงความสามารถในการทำงานภายใต้กรอบการกำกับดูแลของสถาบันที่เข้มงวด และการสร้างร่องรอยการตรวจสอบ (audit trails) ที่ชัดเจน

พิมพ์เขียวสำหรับนักพัฒนาและผู้กำกับดูแล

สำหรับนักพัฒนาและผู้ก่อตั้งสตาร์ทอัพที่สร้าง AI ด้านการดูแลสุขภาพ PULSE มอบสิ่งที่ตลาดต้องการอย่างเร่งด่วน นั่นคือมาตรฐานที่มองเห็นได้และได้รับการสนับสนุนจากรัฐบาล บริษัทเกิดใหม่มักประสบปัญหาในการขายผลิตภัณฑ์เข้าสู่ระบบสาธารณสุข เนื่องจากเจ้าหน้าที่จัดซื้อไม่มีรายการตรวจสอบ (checklist) มาตรฐานในการประเมินความปลอดภัยของ AI หาก PULSE สามารถสร้างเกณฑ์ที่โปร่งใสในการวัดความลำเอียง (bias) ความแม่นยำ และความเป็นส่วนตัวในสภาพแวดล้อมการบริหารจัดการด้านสุขภาพ เกณฑ์เหล่านั้นก็อาจกลายเป็นบรรทัดฐานมาตรฐานสำหรับผู้ให้บริการทั่วประเทศได้อย่างรวดเร็ว

โครงการนี้ยังบ่งชี้ถึงแนวทางที่โมเดลภาษาขนาดใหญ่ (LLMs) อาจจำเป็นต้องพัฒนาเพื่อรับใช้ภาครัฐ แชทบอทสำหรับผู้บริโภคถูกปรับแต่งมาเพื่อให้ตอบโต้ได้อย่างลื่นไหลและเป็นประโยชน์ แต่งานด้านสาธารณสุขของรัฐต้องการการอ้างอิง การระบุระดับความไม่แน่นอนที่ผ่านการปรับเทียบแล้ว (calibrated uncertainty) และความจำของสถาบัน (institutional memory) โมเดลที่ให้คำแนะนำแก่พยาบาลระบาดวิทยาต้องกล้าที่จะกล่าวว่า "หลักฐานยังไม่ชัดเจน" แทนที่จะสร้างคำตอบที่ดูมั่นใจแต่ผิดพลาดขึ้นมา การเฝ้าดูว่า OpenAI และ Anthropic ปรับกลยุทธ์การเขียนคำสั่ง (prompting strategies) และระบบการดึงข้อมูล (retrieval systems) ให้เข้ากับสภาพแวดล้อมนี้อย่างไร จะเผยให้เห็นว่าเทคโนโลยีพื้นฐานสามารถตอบสนองความคาดหวังของระบบราชการได้จริงหรือไม่

หากโครงการนำร่องประสบความสำเร็จ ข้อมูลเชิงลึกด้านเทคนิคและการกำกับดูแลอาจขยายผลไปไกลกว่าพรมแดนของสหรัฐฯ หน่วยงานสาธารณสุขทั่วโลกต่างเผชิญกับภาระด้านข้อมูลและการขาดแคลนบุคลากรในลักษณะเดียวกัน กรอบการทำงานที่ผ่านการรับรองสำหรับการใช้งาน LLMs ในด้านระบาดวิทยาและการสื่อสารด้านสุขภาพ อาจกลายเป็นจุดอ้างอิงระดับสากล เช่นเดียวกับที่มาตรฐาน FHIR เคยทำไว้สำหรับระเบียนสุขภาพอิเล็กทรอนิกส์

บทสรุปที่แท้จริง

PULSE ไม่ใช่คำมั่นสัญญาว่าปัญญาประดิษฐ์จะเข้ามาแก้ไขปัญหาด้านสาธารณสุขได้ทั้งหมด แต่มันคือการยอมรับว่าวิธีการประมวลผลข้อมูลสุขภาพแบบเดิมนั้นล่าช้าและต้องใช้แรงงานมากเกินไป และการทดแทนใดๆ จะต้องได้รับการพิสูจน์ภายใต้เงื่อนไขที่สมจริงและหลากหลายก่อนที่จะนำไปใช้ในระดับประเทศ ด้วยการรวมกรอบความปลอดภัยของ CHAI เข้ากับโมเดลระดับแนวหน้า (frontier models) จาก OpenAI และ Anthropic และการบีบให้เครื่องมือเหล่านั้นต้องพิสูจน์ตัวเองในเขตอำนาจศาลที่แตกต่างกันอย่างแท้จริงถึงสิบแห่ง โครงการนี้จึงปฏิบัติต่อ Generative AI ด้วยความระมัดระวังอย่างที่ควรจะเป็น ในขณะเดียวกันก็มอบสนามทดสอบที่จำเป็นให้แก่เทคโนโลยีนี้ด้วย สำหรับเจ้าหน้าที่สาธารณสุข นักพัฒนา และชุมชนที่พวกเขาดูแล ความสมดุลดังกล่าวคือภาพลักษณ์ที่แท้จริงของการนำเทคโนโลยีมาใช้ได้อย่างมีความรับผิดชอบ