LLM ขนาด 180 ล้านพารามิเตอร์ บนชิปราคา 10 ดอลลาร์
โปรเจกต์ใหม่ที่ชื่อว่า p-for-llm กำลังทำสิ่งที่น่าประทับใจ โดยการรันโมเดลขนาด 180.9 ล้านพารามิเตอร์บนไมโครคอนโทรลเลอร์ ESP32-P4 ซึ่งชิปนี้มีราคาอยู่ระหว่าง 6 ถึง 10 ดอลลาร์
โปรเจกต์ AI บนชิปขนาดเล็กที่กลายเป็นไวรัลส่วนใหญ่มักจะเน้นไปที่งานง่ายๆ เช่น การโชว์โมเดลที่เขียนเรื่องสั้น ซึ่งโมเดลเหล่านั้นมักจะมีพารามิเตอร์น้อยมากและใช้งานจริงไม่ได้
p-for-llm นั้นแตกต่างออกไป เพราะมันมุ่งเน้นไปที่การใช้งานจริง
นี่คือวิธีการทำงานของมัน:
- ใช้สถาปัตยกรรม Mixture-of-Experts (MoE)
- ในทุกๆ โทเคน (token) ตัว router จะเลือกผู้เชี่ยวชาญ (expert) 1 รายจากทั้งหมด 29 ราย
- ผู้เชี่ยวชาญอีก 28 รายที่เหลือจะไม่ได้ถูกใช้งาน
- วิธีนี้ช่วยประหยัดพลังงานในการประมวลผลในขณะที่ยังคงรักษาความรู้ในระดับสูงไว้ได้
- ใช้ ternary weights เพื่อให้โมเดลสามารถบรรจุลงในหน่วยความจำขนาดเล็กได้
- โมเดลสามารถสร้างโทเคนได้ประมาณ 9 โทเคนต่อวินาที
กระบวนการฝึกฝน (training) ก็น่าสนใจเช่นกัน ผู้พัฒนาใช้เพียงการ์ดจอสำหรับผู้บริโภคอย่าง RTX 5060 Ti เพียงใบเดียว ไม่ได้มีห้องแล็บขนาดใหญ่หรือมีงบประมาณมหาศาล มีเพียงคนคนเดียวกับ GPU ระดับกลางและความอดทนเท่านั้น
มีข้อควรระวังหนึ่งอย่างที่คุณควรทราบ คือโมเดลนี้ยังไม่สามารถทำงานได้ด้วยตัวเองอย่างสมบูรณ์ คุณต้องส่งค่า weights ไปยังบอร์ดผ่าน USB ในตอนเริ่มต้นใช้งาน มันยังไม่ใช่เครื่องแบบ standalone ที่โหลดข้อมูลจาก SD card ได้
นี่ไม่ใช่การสาธิตผ่านระบบคลาวด์ การคำนวณทั้งหมดเกิดขึ้นภายในชิปโดยตรง ซึ่งถือเป็นก้าวสำคัญที่เหนือกว่าโปรเจกต์ที่ทำเพียงแค่ส่งข้อมูลสตรีมไปยังเซิร์ฟเวอร์
ทำไมเรื่องนี้ถึงสำคัญ?
โดยปกติแล้วโมเดลขนาดเล็กมักจะถึงทางตัน พวกมันอาจจะดูน่าสนใจ แต่ไม่สามารถทำตามคำสั่งได้ p-for-llm พยายามที่จะก้าวข้ามขีดจำกัดนั้น โดยรองรับ ChatML prompts และเริ่มแสดงสัญญาณของการทำ tool calling ได้แล้ว
โปรเจกต์นี้แสดงให้เห็นว่าความก้าวหน้าที่แท้จริงมักเกิดขึ้นอย่างเงียบๆ ในขณะที่โปรเจกต์ที่เป็นไวรัลมักจะวิ่งตามกระแสข่าว แต่นักพัฒนาที่จริงจังจะเผยแพร่ทั้งข้อจำกัดและรายละเอียดปลีกย่อยของพวกเขา
ผมจะทำการทดสอบฮาร์ดแวร์นี้ด้วยตัวเองเพื่อยืนยันตัวเลขเหล่านี้
ชุมชนแห่งการเรียนรู้เพิ่มเติม: https://t.me/GyaanSetuAi
