Microsoft ประกาศเปิดตัว BitNet framework แบบโอเพนซอร์ส ซึ่งเป็นเครื่องมือที่ช่วยให้นักพัฒนาสามารถรันโมเดลภาษาขนาดใหญ่ (LLMs) แบบ 1-bit บน CPU เพียงตัวเดียวได้ และอ้างว่าสามารถเพิ่มความเร็วได้สูงสุดถึง 6 เท่าเมื่อเทียบกับโค้ดสำหรับการทำ inference บน CPU ที่มีอยู่ในปัจจุบัน

ทำไมโมเดลแบบ 1-bit ถึงมีความสำคัญ

LLM สมัยใหม่ส่วนใหญ่ใช้ตัวเลขทศนิยมแบบ floating-point ขนาด 16 หรือ 32 บิต ซึ่งทำให้ต้องใช้หน่วยความจำและพลังงานสูง BitNet เปลี่ยนมาใช้การคำนวณแบบ “1.58-bit” แทน โดยจำกัดค่าน้ำหนัก (weight) แต่ละค่าให้อยู่ในรูปแบบ –1, 0 หรือ +1 เท่านั้น การลดขนาดนี้ช่วยลดขนาดโมเดลลงอย่างมหาศาล โดยเครือข่ายที่มีพารามิเตอร์ถึง 1 แสนล้านพารามิเตอร์ก็อาจสามารถรันบน CPU ระดับแล็ปท็อปได้ นักพัฒนาจำเป็นต้องฝึกฝน (train) โมเดลขึ้นมาใหม่ตั้งแต่ต้นโดยใช้สถาปัตยกรรม BitNet เพราะนี่ไม่ใช่แค่การแปลงรูปแบบธรรมดา

ประสิทธิภาพที่รายงาน

  • Throughput: 5–7 โทเคนต่อวินาทีบน CPU core เดียว
  • ความเร็วเมื่อเทียบกับ llama.cpp: เร็วกว่า 2.37×–6.17× บนโปรเซสเซอร์ x86
  • การใช้พลังงาน: ใช้พลังงานน้อยลงสูงสุดถึง 82.2% บนฮาร์ดแวร์ชุดเดิม
  • หน่วยความจำ: ต้องการ RAM น้อยลง 16×–32× เท่า

โมเดลเรือธงที่ปล่อยออกมาพร้อมกับชุดโค้ดคือ BitNet-b1.58-2B-4T ซึ่งมีพารามิเตอร์ 2.4 พันล้านพารามิเตอร์ Microsoft เผยแพร่ซอฟต์แวร์ภายใต้ใบอนุญาต MIT ที่มีความยืดหยุ่นสูง โดยเชิญชวนให้ทุกคนสามารถสร้าง แก้ไข หรือแจกจ่ายโมเดลแบบ 1-bit ของตนเองได้

กรณีการใช้งานแบบ Edge-first

การทำ inference โดยไม่ต้องใช้ GPU ช่วยเปิดโอกาสสำหรับแอปพลิเคชันที่ใช้งานแบบออฟไลน์หรือแอปพลิเคชันที่เน้นความเป็นส่วนตัว อุปกรณ์ IoT ขนาดเล็ก, โดรนที่ใช้งานในภาคสนาม และแล็ปท็อปที่ไม่มีการเชื่อมต่ออินเทอร์เน็ต จะสามารถฝังความสามารถด้านภาษาไว้ในตัวเครื่องได้โดยตรง การใช้พลังงานที่ต่ำลงยังดึงดูดใจสำหรับฮาร์ดแวร์ที่ใช้พลังงานจากแบตเตอรี่อีกด้วย

ข้อจำกัดที่มี

อุปสรรคที่ใหญ่ที่สุดคือการต้องฝึกฝนโมเดลขึ้นมาใหม่ตั้งแต่ต้น โมเดลโอเพนซอร์สที่มีอยู่เดิมอย่าง Llama ไม่สามารถนำมาทำ "bit-quantization" ให้เป็นรูปแบบ BitNet ได้โดยตรง แต่ต้องสร้างขึ้นใหม่ด้วยระบบค่าน้ำหนักแบบสามค่า (three-value weight scheme)

ใครได้ประโยชน์ และใครจะยังคงเหมือนเดิม

  • สตาร์ทอัพและผู้ที่สนใจทั่วไป: ต้นทุนฮาร์ดแวร์ที่ต่ำลงอาจช่วยเร่งการทดลองและการสร้างต้นแบบผลิตภัณฑ์
  • องค์กรที่มีนโยบายอธิปไตยของข้อมูล (data-sovereignty) ที่เข้มงวด: การทำ inference แบบ On-premise ช่วยหลีกเลี่ยงการส่งข้อมูลไปยังผู้ให้บริการคลาวด์
  • ห้องปฏิบัติการ AI ขนาดใหญ่: มีแนวโน้มที่จะยังคงใช้ GPU สำหรับการฝึกฝนและการให้บริการที่มี throughput สูง ซึ่งความเร็วในการประมวลผลยังคงเป็นสิ่งสำคัญ

สิ่งที่ต้องจับตามองต่อไป

  • การยอมรับจากชุมชน: จำนวนโมเดลจากบุคคลที่สามที่ถูกฝึกฝนในรูปแบบ BitNet จะแสดงให้เห็นว่าระบบนิเวศนี้เติบโตเร็วเพียงใด
  • การบูรณาการเครื่องมือ: ความเข้ากันได้กับ training pipelines และแพลตฟอร์มการปรับใช้ (deployment) ที่เป็นที่นิยม จะช่วยให้ framework นี้เข้าถึงได้ง่ายขึ้น
  • การทดสอบประสิทธิภาพในโลกจริง: การวัดค่าความแม่นยำ, ความหน่วง (latency) และการใช้พลังงานอย่างเป็นอิสระบนฮาร์ดแวร์ที่หลากหลาย จะเผยให้เห็นว่าประสิทธิภาพที่กล่าวอ้างนั้นสามารถทำได้จริงนอกห้องปฏิบัติการหรือไม่
  • การวิจัยด้าน quantization เพิ่มเติม: หากนักวิจัยสามารถลดความกว้างของบิต (bit-width) ให้ต่ำลงไปอีกโดยไม่สูญเสียคุณภาพ ความฝันในการรันโมเดลบน CPU เพียงอย่างเดียวก็จะกลายเป็นจริงได้มากขึ้น

BitNet พิสูจน์ให้เห็นว่าการรันโมเดลภาษาขนาดใหญ่บนโปรเซสเซอร์ทั่วไปนั้นสามารถทำได้จริงในทางเทคนิค แต่มันไม่ได้ทำให้ความจำเป็นในการใช้ GPU ในสถานการณ์ที่ต้องการประสิทธิภาพสูงหมดไป framework นี้อาจช่วยให้การเข้าถึง AI เป็นเรื่องที่ง่ายขึ้นสำหรับนักพัฒนาในวงกว้าง ในขณะที่ภาระงานด้านการคำนวณหนักๆ ที่ขับเคลื่อนงานวิจัยระดับแนวหน้า (state-of-the-art) ก็น่าจะยังคงต้องพึ่งพา GPU เป็นหลักในอนาคตอันใกล้นี้