แคมเปญการค้นหาโปรตีนที่จับกับเป้าหมาย (protein-binder) แบบอัตโนมัติของ Claude บันทึกอัตราความสำเร็จ (hit rate) ได้ถึง 27% ซึ่งสูงกว่าค่าเฉลี่ย 10-15% ของห้องปฏิบัติการที่ดำเนินการโดยมนุษย์ และแซงหน้าความพยายามของมนุษย์ที่ทำควบคู่กันไปในเป้าหมายเดียวกัน ผลลัพธ์นี้แสดงให้เห็นว่า พรอมต์ (prompt) ขนาดใหญ่ที่ถูกสร้างขึ้นอย่างดีสามารถเปลี่ยนโมเดลภาษาให้กลายเป็นเวิร์กโฟลว์เทคโนโลยีชีวภาพเสมือนจริงได้ แต่ในขณะเดียวกันก็ชี้ให้เห็นว่าแนวทางนี้ยังคงมีความเปราะบางเพียงใดเมื่อค่าความเชื่อมั่น (confidence metrics) ของโมเดลเกิดความผิดพลาด

ตัวเลขจากการทดลอง

Anthropic ได้มอบโปรโตคอลการออกแบบโปรตีนแบบเต็มรูปแบบและงบประมาณ GPU ที่กำหนดไว้ให้กับโมเดล Claude จากนั้นจึงปล่อยให้โมเดลดำเนินแคมเปญแบบครบวงจร (end-to-end) ผ่านเป้าหมายโปรตีน 16 ชนิด มีเป้าหมายหนึ่งถูกยกเลิกเนื่องจากความล้มเหลวในขั้นตอนห้องปฏิบัติการ ทำให้เหลือแคมเปญที่ใช้งานได้ 15 แคมเปญ จากจำนวนนั้น Claude ได้สร้างลำดับโปรตีนที่มีศักยภาพขึ้นมา 1,320 ลำดับ โดยการทดสอบในห้องปฏิบัติการยืนยันว่ามี 354 ลำดับที่เป็นตัวจับ (binders) ที่แท้จริง คิดเป็นอัตราความสำเร็จ 26.8%

เพื่อการเปรียบเทียบ โครงการค้นหาตัวจับที่นำโดยมนุษย์ส่วนใหญ่จะรายงานอัตราความสำเร็จระหว่าง 10% ถึง 15% ในการทดสอบแบบตัวต่อตัวกับเป้าหมาย RBX1 ผู้เข้าร่วมที่เป็นมนุษย์ทำอัตราความสำเร็จได้ 3.7% ในขณะที่การออกแบบของ Claude ทำได้ถึง 31.1% นอกจากนี้ โมเดลยังพิสูจน์ให้เห็นถึงความสามารถในการจัดลำดับด้วยตนเอง (self-ranking) โดยการออกแบบเพียงหนึ่งเดียวที่ Claude ระบุว่าดีที่สุดนั้นประสบความสำเร็จถึง 49% และการออกแบบสิบอันดับแรกประสบความสำเร็จถึง 39%

จุดที่ระบบยังทำได้ไม่ดีพอ

ตัวเลขเหล่านี้ได้ซ่อนจุดบอดที่สำคัญไว้สองประการ Claude ล้มเหลวอย่างสิ้นเชิงในเป้าหมาย MBP และทำผลงานได้ไม่ดีในเป้าหมาย TNFα แต่คะแนนความเชื่อมั่นภายใน (internal confidence scores) ของโมเดลกลับยังคงสูงในการทดสอบเหล่านั้น กล่าวอีกนัยหนึ่งคือ โมเดลเชื่อมั่นว่าตนเองกำลังประสบความสำเร็จ ในขณะที่ผลการทดสอบในห้องปฏิบัติการ (wet-lab) บอกเล่าเรื่องราวที่ต่างออกไป สัญญาณที่วัดค่าผิดพลาดเหล่านี้เผยให้เห็นความเสี่ยงว่า ไพป์ไลน์อัตโนมัติที่เชื่อมั่นในตัวชี้วัดของตนเองอาจทำให้เสียทรัพยากรไปกับการทดลองที่ไม่มีทางเป็นไปได้

Prompt engineering ในฐานะสมุดบันทึกห้องปฏิบัติการเล่มใหม่

แง่มุมที่น่าทึ่งที่สุดของการศึกษานี้ไม่ใช่เรื่องของชีววิทยา แต่เป็นพรอมต์ที่ขับเคลื่อนมัน นักวิทยาศาสตร์อาวุโสมักต้องใช้เวลาหลายสัปดาห์ในการตัดสินใจว่าจะสำรวจบริเวณใดของโปรตีน จะใช้เครื่องมือคำนวณใด และจะจัดสรรเวลาในการประมวลผลอย่างไร Anthropic ได้บีบอัดความเชี่ยวชาญเหล่านั้นลงในพรอมต์ความยาว 16,000 คำ ซึ่งมีความยาวพอๆ กับนวนิยายขนาดสั้น โดยประมาณสองในสามของเนื้อหาเกี่ยวข้องกับประเด็นด้านการดำเนินงาน ได้แก่ เรื่องเวลา การตรวจสอบงบประมาณ และการประสานงานเอเจนต์ย่อย (sub-agents) ที่เรียกใช้ซอฟต์แวร์ภายนอก

Claude เรียกใช้เครื่องมือออกแบบโอเพนซอร์ส เช่น RFdiffusion (เครื่องมือสร้างโครงสร้างแบบ diffusion-based) และ ProteinMPNN (เครือข่ายการออกแบบลำดับโปรตีน) โดยโมเดลภาษาทำหน้าที่เป็นตัวจัดตารางงาน (scheduler) ที่คอยส่งผลลัพธ์ระหว่างเครื่องมือเหล่านี้ ปรับแต่งพารามิเตอร์ และตัดสินใจว่าเมื่อใดควรหยุดวงจรการออกแบบ ในทางปฏิบัติ พรอมต์นี้จึงกลายเป็นผู้จัดการห้องปฏิบัติการเสมือนจริง ที่ช่วยปลดปล่อยนักวิทยาศาสตร์จากการประสานงานเวิร์กโฟลว์ที่จุกจิก

ตัวจับเหล่านี้คืออะไรกันแน่

ผลลัพธ์ที่ยืนยันแล้วทั้ง 354 รายการคือโมเลกุลที่สามารถจับกับโปรตีนเป้าหมายได้จริง งานวิจัยรายงานถึงการทดสอบการจับกัน (binding assays) แต่ไม่ได้ให้ข้อมูลด้านการทำงาน (functional data) เช่น หลักฐานที่ว่าตัวจับนั้นสามารถปรับเปลี่ยนการทำงาน ทำให้โครงสร้าง (conformation) เสถียร หรือแสดงศักยภาพในการรักษาได้หรือไม่ ในทำนองเดียวกัน ยังขาดการตรวจสอบโครงสร้าง (เช่น X-ray crystallography หรือ cryo-EM) ดังนั้นรูปแบบการจับที่แน่นอนจึงยังเป็นเพียงการคาดการณ์ ดังนั้นแคมเปญนี้จึงเป็นการพิสูจน์แนวคิด (proof-of-concept) สำหรับการค้นหาตัวจับอย่างรวดเร็ว ไม่ใช่ไพป์ไลน์ที่ส่งมอบยาต้นแบบ

เดิมพันสำหรับเทคโนโลยีชีวภาพและการวิจัย AI

หากโมเดลที่ขับเคลื่อนด้วยพรอมต์สามารถทำซ้ำหรือทำอัตราความสำเร็จได้สูงกว่ามนุษย์อย่างน่าเชื่อถือ บริษัทเทคโนโลยีชีวภาพอาจสามารถลดต้นทุนและเวลาในการค้นคว้าในระยะเริ่มต้นลงได้อย่างมหาศาล อย่างไรก็ตาม คะแนนความเชื่อมั่นที่ผิดพลาดใน MBP และ TNFα แสดงให้เห็นว่าระบบที่ทำงานโดยไม่ต้องมีมนุษย์ควบคุมเลยนั้นยังไม่พร้อมสำหรับการใช้งานจริง บริษัทต่างๆ ยังคงต้องการการกำกับดูแลจากมนุษย์เพื่อตีความตัวชี้วัดความเชื่อมั่นและตรวจสอบความเกี่ยวข้องด้านการทำงาน

ในมุมมองของ AI งานนี้ได้ลบเส้นแบ่งระหว่าง "เครื่องมือ" (tool) และ "เอเจนต์" (agent) Claude ไม่ใช่อัลกอริทึมการออกแบบโปรตีนตัวใหม่ แต่เป็นโมเดลภาษาอเนกประสงค์ที่สามารถประสานเครื่องมือเฉพาะทางที่มีอยู่แล้วได้ เมื่อได้รับชุดคำสั่งที่ละเอียดเพียงพอ การทดลองนี้ชี้ให้เห็นถึงอนาคตที่ AI ทำหน้าที่เป็น "กาว" ที่เชื่อมโยงระบบนิเวศของซอฟต์แวร์วิทยาศาสตร์แบบโมดูลาร์ที่เป็นโอเพนซอร์สเข้าด้วยกัน แทนที่จะเข้ามาแทนที่ส่วนประกอบใดส่วนประกอบหนึ่ง

มุมมองต่าง: ต้นทุนที่ซ่อนอยู่ของความซับซ้อนในพรอมต์

แม้ว่าการศึกษานี้จะยกย่องพรอมต์ความยาว 16,000 คำว่าเป็นชัยชนะของการรวบรวมองค์ความรู้ แต่ขนาดของพรอมต์นั้นเองก็นำมาซึ่งความกังวลในทางปฏิบัติ การสร้างเอกสารเช่นนี้ต้องใช้ความเชี่ยวชาญเฉพาะทางอย่างลึกซึ้ง ความคุ้นเคยกับเครื่องมือที่เกี่ยวข้อง และความสามารถในการคาดการณ์กรณีขอบเขต (edge cases) กล่าวอีกนัยหนึ่งคือ ความเชี่ยวชาญไม่ได้หายไปไหน แต่มันได้ย้ายจากนักวิทยาศาสตร์หน้างาน (bench scientists) ไปสู่พรอมต์เอนจิเนียร์ (prompt engineers) แทน

นอกจากนี้ การพึ่งพางบประมาณ GPU ที่คงที่ยังนำไปสู่ข้อจำกัดที่ตายตัวต่อความลึกในการสำรวจ (exploration depth) ในขณะที่ทีมงานที่เป็นมนุษย์สามารถจัดสรรทรัพยากรใหม่ได้อย่างยืดหยุ่นตามผลลัพธ์ระหว่างทาง แต่แคมเปญของ Claude กลับยึดตามงบประมาณที่ตั้งไว้ล่วงหน้า ซึ่งอาจจำกัดความกว้างของพื้นที่ลำดับ (sequence space) ที่ถูกสุ่มตัวอย่าง

สิ่งที่ควรจับตามองต่อไป

งานวิจัยของ Anthropic ยังทิ้งคำถามที่ยังไม่มีคำตอบไว้หลายประการ งานในอนาคตจำเป็นต้องจัดการเรื่องการปรับเทียบความเชื่อมั่น (confidence calibration) เพื่อให้การประเมินตนเองของโมเดลสอดคล้องกับผลลัพธ์จากการทดลอง การรวมการทดสอบการทำงาน (functional assays) เช่น การยับยั้งเอนไซม์ (enzymatic inhibition) หรือกิจกรรมของเซลล์ (cellular activity) เข้าไปในวงจรการทำงานอัตโนมัติ จะช่วยขับเคลื่อนเทคโนโลยีนี้ให้เข้าใกล้การค้นหายา (drug discovery) มากกว่าแค่การระบุตัวจับ (binder identification) และท้ายที่สุด การทดสอบเปรียบเทียบ (benchmarking) แนวทางนี้กับเป้าหมายที่หลากหลายขึ้นภายใต้เงื่อนไขงบประมาณที่แตกต่างกัน จะช่วยเผยให้เห็นว่าอัตราการพบสารที่ออกฤทธิ์ (hit rate) ที่สังเกตได้นั้นสามารถทำซ้ำได้หรือเป็นเพียงค่าที่ผิดปกติ (outlier)

บทสรุปนั้นชัดเจน: การจัดการ prompt อย่างละเอียดสามารถเปลี่ยนโมเดลภาษาให้กลายเป็นห้องแล็บไบโอเทคเสมือนจริง ซึ่งให้ผลลัพธ์อัตราการพบ binder ที่สูงกว่าค่าเฉลี่ยของมนุษย์ อย่างไรก็ตาม แนวทางนี้ยังคงต้องพึ่งพาการเขียน prompt โดยผู้เชี่ยวชาญ และยังประสบปัญหาเรื่องความผิดพลาดในการประเมินความเชื่อมั่น (confidence misfires) ซึ่งอาจทำให้การทดลองที่มีค่าใช้จ่ายสูงต้องล้มเหลว ในขณะที่ชุมชนนักวิจัยกำลังปรับปรุงกระบวนการเหล่านี้ ความสมดุลระหว่างความเป็นอิสระของ AI และการกำกับดูแลโดยมนุษย์จะเป็นตัวกำหนดว่าระบบดังกล่าวจะกลายเป็นเครื่องมือมาตรฐาน หรือจะเป็นเพียงสิ่งที่น่าสนใจในเชิงทดลองเท่านั้น