นักวิจัยแสดงให้เห็นว่าทรานส์ฟอร์เมอร์บริบทระยะยาว (long-context transformers) ที่สามารถขยายขนาดได้แบบเชิงเส้น สามารถฝึกฝนโมเดลภาษาแบบมาสก์ (masked language models) บนลำดับโปรตีนได้โดยไม่เกิดปัญหาหน่วยความจำพุ่งสูงขึ้นอย่างมหาศาลเหมือนที่เกิดขึ้นกับทรานส์ฟอร์เมอร์มาตรฐาน ด้วยการเปลี่ยนต้นทุนหน่วยความจำจากแบบกำลังสอง (quadratic) มาเป็นแบบเชิงเส้น (linear) วิธีนี้ช่วยให้นักวิทยาศาสตร์สามารถทำงานกับโปรตีนที่มีความยาวมากกว่าที่เคยทำได้ ซึ่งเป็นขั้นตอนที่อาจช่วยเร่งการค้นพบยาและการวิจัยด้านเทคโนโลยีชีวภาพ

ทำไม Transformer มาตรฐานถึงถึงทางตัน

ฐานข้อมูลโปรตีนประกอบด้วยลำดับที่มักมีความยาวหลายพันกรดอะมิโน โมเดล Transformer แบบดั้งเดิมจะคำนวณค่า attention ระหว่างทุกคู่ของตำแหน่ง ซึ่งเป็นกระบวนการที่เติบโตตามกำลังสองของความยาวลำดับ เมื่อลำดับยาวขึ้น การใช้งานหน่วยความจำจะพุ่งสูงขึ้นอย่างรวดเร็ว บีบให้ผู้ใช้งานต้องตัดทอนโปรตีนหรือแบ่งออกเป็นชิ้นส่วนย่อยๆ การสูญเสียบริบทนี้ขัดขวางความสามารถของโมเดลในการเรียนรู้รูปแบบโครงสร้าง (structural motifs) ที่ครอบคลุมส่วนใหญ่ของสายโซ่

การก้าวกระโดดสู่การขยายขนาดแบบเชิงเส้น

แนวทางใหม่นี้แทนที่ full self-attention ด้วยการออกแบบที่หน่วยความจำเติบโตเพียงแบบเชิงเส้นตามความยาวลำดับ ในทางปฏิบัติ โมเดลสามารถประมวลผลโปรตีนทั้งโมเลกุลได้ในการทำงานเพียงรอบเดียว (one pass) ซึ่งช่วยรักษาปฏิสัมพันธ์ระยะไกล (long-range interactions) ที่สำคัญต่อการม้วนตัว (folding) และการทำงานของโปรตีน เนื่องจากอัลกอริทึมต้องการทรัพยากรหน่วยความจำน้อยกว่ามาก การฝึกฝนบนคลังข้อมูลโปรตีนขนาดใหญ่จึงมีราคาถูกลงและรวดเร็วขึ้น เปิดโอกาสให้มีการใช้เป้าหมายแบบ masked-language-model (MLM) ที่เข้มข้นยิ่งขึ้น ซึ่งสามารถมาสก์และทำนายกรดอะมิโนได้ตลอดทั้งสายโซ่

ความหมายต่อวงการชีววิทยา

การแทนค่าโปรตีนที่ยาวขึ้นและไม่ขาดตอน ช่วยปรับปรุงความเข้าใจของโมเดลเกี่ยวกับโครงสร้างสามมิติ, ตำแหน่งกัมมันต์ (active sites) และรูปแบบวิวัฒนาการ นักวิจัยสามารถทำ pre-train บนชุดข้อมูลลำดับขนาดใหญ่ที่ยังไม่ได้คัดกรอง และทำการ fine-tune สำหรับงานเฉพาะทาง เช่น การทำนายผลกระทบจากการกลายพันธุ์ (mutation-effect prediction) หรือการออกแบบแอนติบอดี การลดภาระการคำนวณยังช่วยลดอุปสรรคสำหรับห้องปฏิบัติการขนาดเล็กในการรันโมเดลที่ล้ำสมัย (state-of-the-art) บนฮาร์ดแวร์ที่มีข้อจำกัด

ข้อควรระวังและคำถามที่ยังไม่มีคำตอบ

การให้ความสำคัญแบบ linear-scale attention มักอาศัยการประมาณค่า เช่น sliding windows, low-rank factorizations หรือ sparse patterns ซึ่งอาจพลาดปฏิสัมพันธ์ที่ละเอียดอ่อนระหว่าง residues ที่อยู่ห่างกัน การทดลองในระยะแรกบ่งชี้ถึงการแลกเปลี่ยน (trade-off) เล็กน้อยระหว่างการประหยัดหน่วยความจำและความแม่นยำในการทำนาย โดยเฉพาะในงานที่ต้องการการจับคู่ระยะไกล (long-range coupling) ที่แม่นยำ นอกจากนี้ สถาปัตยกรรมใหม่ยังเพิ่มความซับซ้อนในการนำไปใช้งาน ซึ่งอาจทำให้การนำไปใช้แพร่หลายช้าลงจนกว่าจะมีไลบรารีที่เสถียรเกิดขึ้น

สิ่งที่ต้องจับตามองต่อไป

ชุมชนนักวิจัยจะเฝ้าติดตามผลการทดสอบมาตรฐาน (benchmark) ที่เปรียบเทียบประสิทธิภาพ protein-MLM ของ linear-scale transformer กับโมเดลแบบดั้งเดิมบนชุดข้อมูลมาตรฐาน การบูรณาการเข้ากับกระบวนการทางชีวสารสนเทศ (bio-informatics pipelines) ที่มีอยู่และการปล่อยซอฟต์แวร์แบบ open-source จะเป็นตัวกำหนดว่าเทคนิคนี้จะแพร่หลายเร็วเพียงใด หากช่องว่างด้านความแม่นยำแคบลง วิธีนี้อาจกลายเป็นมาตรฐานสำหรับการทำ protein language modeling ขนาดใหญ่ ซึ่งจะเปลี่ยนโฉมหน้าการแก้ปัญหาการม้วนตัวของโปรตีน (protein folding problem) ในทางชีววิทยาเชิงคำนวณ

สรุปประเด็นสำคัญ: ด้วยการลดความต้องการหน่วยความจำจากแบบกำลังสองมาเป็นแบบเชิงเส้น ทรานส์ฟอร์เมอร์บริบทระยะยาวจึงทำให้ลำดับโปรตีนแบบเต็มความยาวสามารถนำมาใช้งานในการทำ masked language modeling ได้จริง ซึ่งสัญญาว่าจะให้ข้อมูลเชิงลึกทางชีววิทยาที่ลึกซึ้งยิ่งขึ้นในขณะที่ยังควบคุมต้นทุนการคำนวณไว้ได้