GSK ได้ลงนามในความร่วมมือด้านการวิจัยกับ Relation Therapeutics บริษัทเทคโนโลยีชีวภาพจากอังกฤษ โดยมีมูลค่าสูงถึง 110 ล้านดอลลาร์สหรัฐ ความร่วมมือในครั้งนี้จะสร้างชุดข้อมูลขนาดใหญ่ที่มีความละเอียดสูง เพื่อติดตามว่าเซลล์ของมนุษย์มีการตอบสนองอย่างไรต่อการเปลี่ยนแปลงทางพันธุกรรมและการรักษาด้วยยา ซึ่งเป็นการมุ่งแก้ปัญหาคอขวดด้านข้อมูลที่ทำให้การค้นหายาด้วย AI ล่าช้า และอาจช่วยย่นระยะเวลาจากขั้นตอนการพัฒนาโมเลกุลไปสู่การเป็นยาจริงได้หลายปี
ปัญหาด้านข้อมูลที่เป็นอุปสรรคต่อ AI
ในช่วงทศวรรษที่ผ่านมา AI ในอุตสาหกรรมยาถูกตัดสินด้วยขนาดของโมเดล มากกว่าความเกี่ยวข้องของข้อมูลนำเข้า โมเดลภาษาขนาดใหญ่ (Large language models) ที่ฝึกฝนด้วยข้อความจากอินเทอร์เน็ตนั้นมีความเชี่ยวชาญในการจับคู่รูปแบบ แต่กลับประสบปัญหาเมื่อต้องทำนายว่าสารประกอบหนึ่งๆ จะส่งผลกระทบต่อเนื่องอย่างไรภายในเซลล์ที่มีชีวิต จิ๊กซอว์ชิ้นที่ขาดหายไปคือข้อมูลจาก “wet lab” ซึ่งก็คือผลการวัดจากการทดลองจริงที่บันทึกลำดับเหตุการณ์ของผลกระทบทางชีวภาพ หลังจากที่ยีนถูกเปิดหรือปิดการทำงาน หรือหลังจากที่มีการใช้ยา
Relation Therapeutics จะเข้ามาเติมเต็มช่องว่างนั้น ภายใต้ข้อตกลงนี้ บริษัทจะสร้างข้อมูลขนาดใหญ่ที่วัดผลอย่างละเอียดว่าเซลล์ของมนุษย์ตอบสนองต่อตัวแปรสองประการอย่างไร ได้แก่ การเปลี่ยนแปลงทางพันธุกรรมและการแทรกแซงด้วยยา การป้อนข้อมูลพฤติกรรมของเซลล์ที่มีความละเอียดสูงเช่นนี้ให้แก่ระบบ AI มีเป้าหมายเพื่อให้โมเดลเปลี่ยนจากการทำนายการจับกัน (binding) แบบหยาบๆ ไปสู่การจำลองเส้นทางชีวภาพ (pathways) ทั้งหมด
จากการทำนายแบบกล่องดำ (black-box) สู่ความแม่นยำระดับเซลล์
กระบวนการทำงานของ AI แบบดั้งเดิมมักจะให้ผลลัพธ์เป็นตัวเลขเพียงค่าเดียว นั่นคือความน่าจะเป็นที่โมเลกุลจะจับกับโปรตีนเป้าหมาย จากนั้นนักวิจัยต้องใช้เวลาหลายเดือนหรือหลายปีในการทดสอบว่าการจับกันนั้นส่งผลให้เกิดผลทางการรักษาจริงหรือไม่ แนวทางใหม่นี้จะเปลี่ยนจากการประมาณค่าเพียงจุดเดียว เป็นแผนที่หลายมิติของผลลัพธ์ที่จะเกิดขึ้นตามมา (downstream outcomes) เมื่อโมเดล AI ทราบว่าการยับยั้งยีน X จะกระตุ้นเส้นทาง Y และยาที่กำลังพัฒนาสามารถลดการทำงานของเส้นทางเดียวกันนั้นได้ โมเดลก็จะสามารถคาดการณ์ประสิทธิภาพได้เร็วขึ้นมาก
ผลตอบแทนที่ได้คือการลดการทดลองแบบลองผิดลองถูกที่มีค่าใช้จ่ายสูง หากโมเดลสามารถพยากรณ์ได้อย่างแม่นยำว่าสารประกอบจะกระตุ้นการตอบสนองของเซลล์ที่ต้องการได้ ก็ไม่จำเป็นต้องสังเคราะห์ คัดกรอง และทิ้งสารประกอบจำนวนมากเกินความจำเป็น สิ่งนี้ช่วยลดค่าใช้จ่ายด้าน R&D และย่นระยะเวลา ซึ่งเป็นข้อได้เปรียบที่ส่งผลโดยตรงต่อระยะเวลาการครองตลาดของยาและผลกำไรของบริษัทเวชภัณฑ์
“ข้อมูลที่ใช่” กลายเป็นปราการสำคัญ
ความร่วมมือครั้งนี้เน้นย้ำถึงการเปลี่ยนผ่านจาก “big data” ไปสู่ “right data” (ข้อมูลที่ใช่) โมเดลอเนกประสงค์มักจะเติบโตได้ด้วยปริมาณข้อมูลมหาศาล แต่การค้นหายาต้องการข้อมูลที่มีความเฉพาะเจาะจงสูงและหาได้ยาก การสร้างโปรไฟล์การตอบสนองของเซลล์ที่เชื่อถือได้นั้นต้องใช้เครื่องมือที่ทันสมัย บุคลากรที่มีทักษะ และการควบคุมคุณภาพที่เข้มงวด ซึ่งเป็นการลงทุนที่เฉพาะผู้เล่นที่มีเงินทุนหนาเท่านั้นที่สามารถทำได้
บริษัทที่เป็นเจ้าของกระบวนการเชื่อมโยงรหัสพันธุกรรมเข้ากับผลลัพธ์ของเซลล์ที่วัดค่าได้ จะเป็นผู้ถือครองทรัพย์สินทางปัญญาที่มีค่าที่สุด ความเป็นเอกสิทธิ์ของชุดข้อมูลดังกล่าวจะสร้างปราการป้องกันที่เลียนแบบได้ยากกว่าสถาปัตยกรรมโครงข่ายประสาทเทียม (neural network architecture) แบบใหม่ สำหรับผู้ก่อตั้งบริษัทเทคโนโลยีชีวภาพ ข้อความนี้ชัดเจนมาก: การสร้างเครื่องยนต์ข้อมูล (data engine) อาจเป็นกลยุทธ์ที่สำคัญกว่าการวิ่งไล่ตามความก้าวหน้าทางอัลกอริทึมครั้งต่อไป
มุมมองต่าง: ข้อมูลเพียงอย่างเดียวไม่สามารถแก้ปัญหาได้ทุกอย่าง
นักวิจารณ์ตั้งข้อสังเกตว่าแม้แต่ข้อมูลที่สมบูรณ์แบบก็อาจทำให้โมเดล AI เข้าใจผิดได้ เซลล์มีความแตกต่างกันตามประเภทของเนื้อเยื่อ สภาวะของโรค และข้อมูลประชากรของผู้ป่วย ชุดข้อมูลที่เก็บได้ในบริบทหนึ่งอาจไม่สามารถนำไปใช้ครอบคลุมในบริบทอื่นได้ นอกจากนี้ ค่าใช้จ่ายในการสร้างและจัดการชุดข้อมูลขนาดใหญ่ที่มีคุณภาพสูงอาจสูงกว่าค่าใช้จ่ายในการฝึกฝนโมเดลเสียอีก ซึ่งทำให้เกิดคำถามเรื่องความสามารถในการขยายขนาด (scalability) สำหรับบริษัทขนาดเล็ก
หน่วยงานกำกับดูแลก็มีความสำคัญเช่นกัน AI เชิงทำนายที่อ้างว่าสามารถจำลองชีววิทยาของมนุษย์ได้ ในที่สุดแล้วจะต้องได้รับการตรวจสอบเทียบกับผลลัพธ์ทางคลินิก ซึ่งเป็นการเพิ่มขั้นตอนการตรวจสอบที่เข้มงวด หากอุตสาหกรรมพึ่งพาการทำนายแบบ in-silico มากเกินไปโดยไม่มีการทดสอบในโลกความเป็นจริงที่เพียงพอ อาจเผชิญกับความล้มเหลวเมื่อตัวยาที่มีแนวโน้มดีกลับไม่ผ่านการทดสอบทางคลินิก
สิ่งที่ต้องจับตามองต่อไป
ในอีกไม่กี่เดือนข้างหน้า จะเป็นตัวบ่งชี้ว่าความพยายามของ GSK-Relation จะสามารถส่งมอบข้อมูลที่ใช้งานได้ในระดับที่สัญญาไว้หรือไม่ ตัวบ่งชี้สำคัญ ได้แก่:
- การเผยแพร่ชุดข้อมูลมาตรฐาน (benchmark datasets) ที่นักวิจัยคนอื่นๆ สามารถเข้าถึงได้ (แม้จะอยู่ภายใต้เงื่อนไขที่จำกัด)
- โมเดล AI ในระยะเริ่มต้นที่แสดงให้เห็นว่ามีประสิทธิภาพเหนือกว่าวิธีการคัดกรองแบบดั้งเดิมอย่างชัดเจนเมื่อทดสอบกับชุดข้อมูลทดสอบ (held-out test set)
- การลงทุนต่อเนื่องจากบริษัทยักษ์ใหญ่ด้านยาอื่นๆ ซึ่งเป็นสัญญาณความเชื่อมั่นว่าแนวทางการใช้ข้อมูลนี้สามารถทำซ้ำได้
หากความร่วมมือนี้ให้ผลลัพธ์ที่เป็นรูปธรรมในการเพิ่มอัตราความสำเร็จ (hit-rate) หรือลดระยะเวลาการทำงาน (cycle time) มันอาจกระตุ้นให้เกิดดีลในลักษณะเดียวกันเป็นระลอก ซึ่งจะเปลี่ยนรูปแบบการจัดสรรงบประมาณด้าน R&D ของอุตสาหกรรม ในทางกลับกัน หากข้อมูลมีความคลาดเคลื่อน (noisy) มากเกินไปหรือมีต้นทุนในการนำมาใช้งานสูงเกินไป บริษัทต่างๆ อาจกลับไปใช้วิธีแบบไฮบริดที่ผสมผสาน AI เข้ากับการคัดกรองประสิทธิภาพสูงแบบดั้งเดิม (high-throughput screening)
บทสรุป
การเดิมพันมูลค่า 110 ล้านดอลลาร์ของ GSK ในข้อมูลเซลล์ที่มีความเที่ยงตรงสูง (high-fidelity cellular data) ส่งสัญญาณถึงการปรับเปลี่ยนทิศทางครั้งสำคัญ: ในการค้นหายาด้วย AI ความได้เปรียบที่สำคัญที่สุดจะกลายเป็นเรื่องของคุณภาพและความเป็นเอกสิทธิ์ของสัญญาณทางชีวภาพที่ใช้ในการฝึกฝนโมเดลมากขึ้นเรื่อยๆ ไม่ใช่เพียงแค่ขนาดของตัวอัลกอริทึมเอง
