เหนือกว่า Transformer: สตาร์ทอัพผู้กำลังนิยามยุคสมัยใหม่ของ LLMs
ยุคสมัยของ Transformer กำลังเผชิญกับคอขวดที่สำคัญ เมื่อความต้องการด้านการประมวลผลของโมเดลภาษาขนาดใหญ่ (LLMs) กำลังมาถึงจุดวิกฤต แม้ว่างานวิจัย "Attention Is All You Need" ในปี 2017 จะเป็นรากฐานให้กับความบูมของ AI ในปัจจุบัน แต่สตาร์ทอัพรุ่นใหม่กำลังเร่งรีบที่จะเข้ามาแทนที่หรือสร้างสถาปัตยกรรมหลักขึ้นมาใหม่ เพื่อบรรลุประสิทธิภาพที่แท้จริง
คอขวดของ Transformer: ทำไม Dense Attention ถึงกำลังไปต่อไม่ไหว
เป็นเวลาเกือบหนึ่งทศวรรษที่ Transformer เป็นกลไกขับเคลื่อนอุตสาหกรรม AI โดยอาศัยกลไกที่เรียกว่า "dense attention" กระบวนการนี้จะเปรียบเทียบทุก token ในกลุ่มข้อความกับ token อื่นๆ ทั้งหมดผ่านการคูณในสเกลมหาศาล แม้ว่าจะมีความแม่นยำสูงมากในการจับความหมายเชิงบริบท (semantic meaning) แต่ความซับซ้อนทางคณิตศาสตร์กลับขยายตัวได้ไม่ดีนัก
ตัวอย่างเช่น เอกสารที่มีความยาว 10,000 คำ อาจทำให้ Transformer ต้องทำการคูณประมาณ 50 ล้านครั้ง การเติบโตแบบกำลังสอง (quadratic growth) ในการคำนวณนี้ นำไปสู่ความท้าทายครั้งใหญ่สองประการ ได้แก่ การบริโภคพลังงานที่พุ่งสูงขึ้นอย่างรวดเร็ว และหน้าต่างบริบท (context windows) ที่มีจำกัด ด้วยรายงานที่ว่า OpenAI เตรียมจะใช้เงินถึง 5 หมื่นล้านดอลลาร์ในการประมวลผลในปีนี้ และความต้องการไฟฟ้าของดาต้าเซ็นเตอร์ที่คาดว่าจะเพิ่มขึ้นเป็นสองเท่าภายในปี 2030 อุตสาหกรรมนี้จึงกำลังชนกำแพงทั้งในด้านต้นทุนและข้อจำกัดทางฟิสิกส์
การคิดใหม่เรื่อง Attention: การผงาดขึ้นของกลไกแบบ Sparse
เพื่อแก้ปัญหาวิกฤตด้านประสิทธิภาพ สตาร์ทอัพหลายแห่งกำลังพยายามเปลี่ยนจาก dense attention ไปสู่ "sparse attention" แทนที่จะคำนวณการจับคู่คำที่เป็นไปได้ทั้งหมด sparse attention จะมุ่งเน้นไปที่การเชื่อมโยงที่เกี่ยวข้องมากที่สุดเท่านั้น ซึ่งช่วยลดภาระในการประมวลผลลงได้อย่างมหาศาล
Subquadratic สตาร์ทอัพจากไมอามี คือผู้นำในด้านนี้ด้วยโมเดล SubQ ของพวกเขา ต่างจากกลไกแบบ sparse ก่อนหน้านี้ที่มักประสบปัญหาในการรักษาความแม่นยำ Subquadratic อ้างว่าเทคโนโลยีของพวกเขาสามารถเทียบเคียงกับ LLMs กระแสหลักในงานเฉพาะทาง เช่น การเขียนโค้ดและการค้นหา แนวทางของพวกเขาเกี่ยวข้องกับระบบไดนามิกที่ระบุว่าคำใดที่มีความสำคัญต่อข้อความนั้นๆ ได้ทันที (on the fly) แทนที่จะเสียทรัพยากรไปกับ token ที่ไม่เกี่ยวข้อง
Power Retention: การก้าวไปสู่การสรุปแบบต่อเนื่อง (Rolling Summaries)
อีกแนวทางหนึ่งคือการละทิ้งกลไก attention ไปเลย Manifest AI สตาร์ทอัพจากซานฟรานซิสโก กำลังบุกเบิกเทคนิคที่เรียกว่า "power retention" ในขณะที่โมเดลแบบ sparse attention อย่าง SubQ ยังคงพยายามรักษาภาพรวมของ context window ทั้งหมดไว้ แต่ power retention ทำงานโดยการให้โมเดลใช้การสรุปความจำแบบต่อเนื่อง (rolling summary) แทน
เมื่อมีข้อมูลใหม่เข้ามาใน context window โมเดลจะระบุและตัดข้อมูลที่เกี่ยวข้องน้อยกว่าออก เพื่อให้มั่นใจว่าภาระการประมวลผลจะยังคงอยู่ในระดับที่จัดการได้ ไม่ว่าขนาดของข้อมูลนำเข้าจะเป็นอย่างไร Manifest AI ได้แสดงให้เห็นถึงความเป็นไปได้ของแนวทางนี้แล้วโดย:
- การเปลี่ยนโมเดลโอเพนซอร์ส StarCoder ให้เป็น PowerCoder โดยใช้เทคนิค power retention
- การเปิดตัว Brumby โมเดลที่พวกเขาอ้างว่าสามารถเทียบเคียงกับโมเดลโอเพนซอร์ส Qwen ที่ได้รับความนิยมของ Alibaba ได้
ความสามารถในการปรับเปลี่ยนโมเดล Transformer ที่มีอยู่ให้เป็นโมเดลแบบ power retention โดยใช้การฝึกฝนใหม่ (retraining) เพียงเล็กน้อย บ่งชี้ว่าการเปลี่ยนผ่านไปสู่ "LLMs+" ซึ่งเป็นโมเดลยุคถัดไป อาจเกิดขึ้นได้เร็วกว่าที่คาดการณ์ไว้มาก
สรุปประเด็นสำคัญ
- ขีดจำกัดของ Transformer: การขยายตัวแบบกำลังสอง (quadratic scaling) ของ dense attention ทำให้ LLMs ในปัจจุบันมีค่าใช้จ่ายในการรันสูงมาก และยากต่อการขยายขนาดเพื่อรองรับชุดข้อมูลมหาศาลหรือการใช้เหตุผลในเนื้อหายาวๆ
- Sparse vs. Retention: สตาร์ทอัพกำลังแก้ปัญหานี้จากสองด้าน: Subquadratic กำลังเพิ่มประสิทธิภาพของ attention ผ่านการคำนวณแบบ sparse (SubQ) ในขณะที่ Manifest AI กำลังแทนที่มันด้วยการสรุปความจำแบบต่อเนื่อง (Power Retention)
- ความจำเป็นทางเศรษฐกิจ: เมื่อต้นทุนการประมวลผล AI พุ่งสูงถึงระดับหลายหมื่นล้านดอลลาร์ ผู้ชนะในยุค AI ถัดไปน่าจะเป็นผู้ที่สามารถแก้ปัญหาเรื่องประสิทธิภาพได้ มากกว่าแค่การเพิ่มขนาดเพียงอย่างเดียว
