Prism ML ได้เปิดตัว Bonsai 27B ซึ่งเป็นเวอร์ชันของโมเดลภาษาขนาดใหญ่ Qwen 3.6 ที่สามารถใช้งานบนโทรศัพท์มือถือได้ ด้วยการบีบอัดขนาดจากต้นฉบับ 54 GB ให้เหลือไม่ถึง 4 GB ผ่านเทคนิค 1-bit quantization ทำให้บริษัทสามารถลดขนาดลงได้ถึง 14 เท่า และช่วยให้ผู้ใช้สามารถรันโมเดลได้ในเครื่อง (locally) โดยไม่ต้องเรียกใช้งานผ่าน cloud API

ทำไมการบีบอัดถึงมีความสำคัญ

โดยปกติแล้ว LLM จำเป็นต้องใช้ GPU ระดับเดสก์ท็อปหรือ API แบบชำระเงิน เนื่องจากค่าน้ำหนัก (weights) ของโมเดลมีขนาดหลายสิบกิกะไบต์ การทำ Quantization หรือการใช้จำนวนบิตต่อค่าน้ำหนักให้น้อยลง จะช่วยลดขนาดโมเดลลงแต่ก็อาจทำให้สูญเสียความรู้ไปด้วย Bonsai นำเสนอสองรูปแบบที่แตกต่างกันอย่างสุดขั้ว ได้แก่ แบบ ternary (มีค่าน้ำหนักที่เป็นไปได้สามค่า ประมาณ 7.2 GB) และแบบ 1-bit ที่เน้นการบีบอัดอย่างหนัก (ประมาณ 3.9 GB) การแลกเปลี่ยนระหว่างขนาดและความสามารถคือหัวใจสำคัญของการทดสอบนี้

ประสิทธิภาพของโมเดลในการจดจำข้อเท็จจริง

โมเดล Qwen 3.6 ต้นฉบับสามารถตอบคำถามเกี่ยวกับวันที่ทางประวัติศาสตร์ในชุดทดสอบได้อย่างถูกต้องทุกข้อ ในขณะที่ Bonsai แบบ ternary ตอบผิดถึง 5 จาก 6 ข้อ และเวอร์ชัน 1-bit ก็ล้มเหลวในการตอบคำถามเกี่ยวกับวันที่ทุกข้อ เป็นไปตามที่คาดไว้ การบีบอัดอย่างหนักจะทำให้ข้อมูลข้อเท็จจริงที่เฉพาะเจาะจงและหาได้ยากหายไปก่อน โดยจะเหลือไว้เพียงรูปแบบภาษาในภาพรวมที่ช่วยให้การสื่อสารลื่นไหล

ประสิทธิภาพด้านการเขียนโค้ดให้ผลลัพธ์ที่ต่างออกไป

เมื่อเปลี่ยนคำสั่ง (prompts) เป็นงานด้านการเขียนโค้ด ผลลัพธ์กลับพลิกผัน โมเดลทั้งสามสามารถแก้ปัญหา concurrency bugs แบบคลาสสิกได้โดยไม่มีข้อผิดพลาด ในโจทย์ความท้าทายด้าน React animation ที่มีความซับซ้อน Bonsai แบบ 1-bit ทำสำเร็จภายใน 2 ครั้ง ในขณะที่โมเดลต้นฉบับต้องใช้ถึง 4 ครั้งเนื่องจากต้องใช้เวลาเพิ่มในการวิเคราะห์โค้ด (parsing) ส่วนเวอร์ชัน ternary ต้องใช้ถึง 10 ครั้ง และในที่สุดก็ทำให้เซิร์ฟเวอร์ทดสอบล่ม

อุปสรรคในการใช้งานจริง

Bonsai ไม่สามารถรันบน Ollama runtime ที่เป็นที่นิยมได้ โมเดลแบบ 1-bit จำเป็นต้องมีเลเยอร์การประมวลผลแบบกำหนดเอง (custom execution layer) ที่จัดทำโดย Prism ML ดังนั้นผู้ใช้จึงต้องติดตั้งซอฟต์แวร์ที่ไม่ใช่มาตรฐานเพื่อให้ใช้งานได้ ข้อจำกัดนี้ทำให้ความน่าสนใจของโมเดลจำกัดอยู่เพียงกลุ่มผู้ใช้ที่คุ้นเคยกับการปรับแต่งสภาพแวดล้อมการทำงาน (environment) ของตนเองเท่านั้น

ใครควรใช้ Bonsai และใครควรหลีกเลี่ยง

  • การแชททั่วไป (General-purpose chat) – การสูญเสียรายละเอียดด้านข้อเท็จจริงอย่างรุนแรงทำให้ Bonsai ไม่เหมาะสำหรับใช้เป็นผู้ช่วยฐานความรู้ หากต้องการคำตอบที่แม่นยำเกี่ยวกับประวัติศาสตร์ วิทยาศาสตร์ หรือเหตุการณ์ปัจจุบัน ควรใช้โมเดลต้นฉบับหรือ cloud API ต่อไป
  • ผู้ช่วยเขียนโค้ดแบบออฟไลน์ (Local coding aide) – นักพัฒนาที่ต้องการเครื่องมือแบบออฟไลน์ที่สามารถแนะนำโค้ด ตรวจจับบั๊ก และรันบนโทรศัพท์หรือแล็ปท็อปสเปกต่ำ จะพบว่าเวอร์ชัน 1-bit ให้ความเร็วและใช้พื้นที่จัดเก็บน้อย แม้มันจะไม่ใช่เอเจนต์อัตโนมัติ (autonomous agent) แต่ก็สามารถจัดการด้านตรรกะและไวยากรณ์ (syntax) ได้อย่างมีประสิทธิภาพ

บทสรุป

Bonsai 27B แสดงให้เห็นว่าคุณสามารถบีบอัด LLM ขนาด 54 GB ให้เหลือเพียง 3.9 GB ซึ่งเหมาะสำหรับโทรศัพท์มือถือ และยังคงได้รับคำแนะนำด้านโค้ดที่รวดเร็วและมีความสามารถอย่างน่าประหลาดใจ สิ่งที่ต้องแลกมาคือการสูญเสียความสามารถในการจดจำข้อเท็จจริงเฉพาะเจาะจงไปเกือบทั้งหมด ดังนั้นโมเดลนี้จึงเหมาะสำหรับเป็นเครื่องมือในกล่องอุปกรณ์ของนักพัฒนาที่ให้ความสำคัญกับความเร็วแบบออฟไลน์มากกว่าความรู้เชิงสารานุกรม