PrismML’s new Bonsai 27B 1-bit model fits into a 3.9 GB file and runs at about 11 tokens per second on an iPhone 17 Pro Max, proof that a 27-billion-parameter language model can live on a consumer smartphone. The claim matters because it pushes the boundary of on-device AI, promising richer offline assistants without sending data to the cloud.

ทำไมการลดขนาดจึงมีความสำคัญ

โมเดล Bonsai 27B แบบความละเอียดเต็ม (full-precision) มีขนาดถึง 54.7 GB แต่ด้วยการทำ quantization ให้เหลือเพียงการแสดงผลแบบ single-bit ทำให้ PrismML สามารถย่อขนาดลงเหลือเพียง 3.9 GB หรือลดลงถึง 14 เท่า การบีบอัดนี้ทำให้ในทางเทคนิคแล้วโมเดลสามารถจัดเก็บไว้ใน iPhone รุ่นระดับสูงได้ ซึ่งเป็นเกณฑ์ที่ก่อนหน้านี้จะจำกัดไว้เพียงโมเดลที่มีขนาดไม่กี่ร้อยเมกะไบต์เท่านั้น

ประสิทธิภาพของโมเดลบนฮาร์ดแวร์ของ Apple

PrismML สร้างโมเดลนี้ขึ้นมาเพื่อรองรับ MLX stack ของ Apple ซึ่งเป็นชุด API ที่ช่วยให้นักพัฒนาสามารถรันโครงข่ายประสาทเทียม (neural nets) บน neural engine ได้โดยตรง จากการทดสอบของตนเอง โมเดลสามารถสร้างข้อมูลได้ประมาณ 11 tokens ต่อวินาทีบน iPhone 17 Pro Max และจากการทดสอบผ่านเกณฑ์มาตรฐาน (benchmarks) ของโมเดลภาษาทั่วไป 15 รายการ พบว่าเวอร์ชัน 1-bit ยังคงรักษาคะแนนคุณภาพไว้ได้ถึง 89.5% ของโมเดลต้นฉบับ ซึ่งบ่งชี้ว่าการบีบอัดไม่ได้ทำให้ประสิทธิภาพการใช้งานลดลงจนใช้งานไม่ได้

ข้อจำกัดในการใช้งานจริงที่คุณต้องเจอ

  • ภาระด้านหน่วยความจำ (Memory pressure) – แม้ไฟล์ขนาด 3.9 GB จะสามารถจัดเก็บได้ แต่โมเดลยังจำเป็นต้องใช้ key-value (KV) cache เพื่อเก็บข้อมูลบริบทล่าสุด ซึ่ง cache นี้จะขยายขนาดขึ้นตามความยาวของการสนทนา และอาจทำให้การใช้งาน RAM ของโทรศัพท์สูงขึ้น จนอาจส่งผลให้ความเร็วในการทำงานลดลง
  • ความร้อนและแบตเตอรี่ – การรันโครงข่ายขนาด 27 พันล้านพารามิเตอร์เป็นการเพิ่มภาระให้กับ neural engine อย่างมาก โทรศัพท์มักจะร้อนขึ้นเมื่อต้องทำงานหนักอย่างต่อเนื่อง และระบบจัดการความร้อนของ Apple จะลดประสิทธิภาพการทำงานลง (throttle) เพื่อปกป้องฮาร์ดแวร์ ทั้งนี้ PrismML ยังไม่ได้เปิดเผยตัวเลขการใช้พลังงานแบตเตอรี่ที่ชัดเจน ดังนั้นผลกระทบต่อการใช้งานจริงตลอดทั้งวันจึงยังไม่เป็นที่ทราบแน่ชัด
  • ข้อจำกัดเฉพาะอุปกรณ์ – คำกล่าวอ้างด้านประสิทธิภาพนี้ใช้กับ iPhone 17 Pro Max รุ่นล่าสุดเท่านั้น iPhone รุ่นเก่ากว่า อุปกรณ์ iOS รุ่นที่สเปกต่ำกว่า หรือโทรศัพท์ Android ขาดความสามารถของ neural engine ในระดับเดียวกัน ซึ่งจะทำให้การประมวลผล (inference) ช้าลง หรืออาจจะไม่สามารถรันโมเดลได้เลย

ใครจะได้ประโยชน์ และใครที่อาจถูกทิ้งไว้ข้างหลัง

นักพัฒนาแอปพลิเคชันที่เน้นความเป็นส่วนตัวสามารถรันโมเดลภาษาขนาดใหญ่บนอุปกรณ์ได้แล้ว โดยเก็บข้อมูลผู้ใช้ไว้ในโทรศัพท์ ซึ่งอาจหมายถึงผู้ช่วยด้วยเสียงที่ตอบสนองได้รวดเร็วขึ้น การแปลภาษาแบบออฟไลน์ หรือการสร้างข้อความตามบริบทโดยไม่ต้องสมัครสมาชิกคลาวด์

ในขณะที่ผู้ผลิต Android และผู้ใช้โทรศัพท์ระดับกลางอาจพลาดโอกาสนี้ เนื่องจากโมเดลนี้พึ่งพา MLX stack ซึ่งเป็นเทคโนโลยีเฉพาะของ Apple ดังนั้นการบีบอัดในลักษณะเดียวกันนี้จึงไม่สามารถใช้งานกับระบบนิเวศ (ecosystem) อื่นได้โดยอัตโนมัติ

สิ่งที่ยังต้องรอการทดสอบ

ตัวเลขของ PrismML มาจากการทดสอบภายใน (internal benchmarks) นักทดสอบอิสระจำเป็นต้องตรวจสอบอัตรา tokens ต่อวินาทีในการใช้งานต่อเนื่องเป็นเวลานาน วัดการใช้พลังงานแบตเตอรี่จริง และประเมินว่าประสิทธิภาพจะลดลงเร็วเพียงใดเมื่อ KV cache ขยายตัวขึ้น การใช้งานในโลกแห่งความเป็นจริง เช่น การแชทนานหนึ่งชั่วโมง การสตรีมเนื้อหา หรือการรันโมเดลไปพร้อมกับแอปพลิเคชันอื่น จะเป็นตัวบ่งชี้ว่าตัวเลข 11 tokens ต่อวินาทีนั้นยังคงรักษาไว้ได้หรือไม่เมื่ออยู่นอกห้องปฏิบัติการที่ควบคุมสภาพแวดล้อมไว้

บทสรุป

Bonsai 27B แสดงให้เห็นว่าโมเดลภาษาขนาด 27 พันล้านพารามิเตอร์สามารถถูกบีบอัดให้มากพอที่จะรันบน iPhone รุ่นเรือธงได้ โดยให้คุณภาพที่ใกล้เคียงกับของเดิมในความเร็วที่พอใช้ได้ ความสำเร็จนี้ขึ้นอยู่กับ MLX stack ของ Apple และยังคงต้องเผชิญกับอุปสรรคในทางปฏิบัติ ได้แก่ ภาระด้านหน่วยความจำ การลดประสิทธิภาพเนื่องจากความร้อน และผลกระทบต่อแบตเตอรี่ที่ยังไม่ทราบแน่ชัด หากการทดสอบในอนาคตยืนยันคำกล่าวอ้างนี้ได้ AI บนอุปกรณ์อาจเปลี่ยนจากการเป็นเพียงตัวอย่างสาธิตเฉพาะกลุ่ม ไปสู่แอปพลิเคชันที่ใช้ในชีวิตประจำวัน—หากช่องว่างทางฮาร์ดแวร์ระหว่าง iPhone รุ่นเรือธงและตลาดส่วนที่เหลือแคบลง