โมเดล Mixture-of-Experts ขนาด 1.5 แสนล้านพารามิเตอร์สามารถสร้างข้อความบนแล็ปท็อปสำหรับนักพัฒนาทั่วไปได้ ผลการทดลองแสดงให้เห็นว่า RAM ไม่ใช่ความเร็วของ SSD คือตัวจำกัดประสิทธิภาพที่แท้จริง เรื่องนี้มีความสำคัญเพราะมันพิสูจน์ว่าโมเดลระดับแนวหน้า (frontier-scale models) สามารถทดสอบในเครื่องส่วนตัวได้โดยไม่ต้องเสียค่าใช้จ่ายด้านการประมวลผลบนคลาวด์

การทดสอบ

เราได้รันโมเดล DeepSeek V4 Flash ซึ่งเป็นโมเดล MoE ขนาด 1.5 แสนล้านพารามิเตอร์ที่ผ่านการทำ REAP-pruning ผ่านเอนจินการอนุมาน (inference engine) แบบโอเพนซอร์สอย่าง Colibrì โดยใช้ฮาร์ดแวร์เป็นแล็ปท็อป AMD Ryzen AI 9 365 ที่มี RAM 61 GB และ NVMe SSD ขนาด 1 TB เราได้จับเวลาการสร้างข้อความเป็นเวลาสามนาทีและบันทึกการเข้าถึงดิสก์ทุกครั้ง

สิ่งที่ตัวเลขบ่งบอก

  • กิจกรรมของดิสก์มีน้อยมาก SSD ใช้เวลาในการอ่านข้อมูลไม่ถึง 11 วินาทีในช่วงการสร้างข้อความสามนาที แม้ว่าไดรฟ์จะสามารถอ่านข้อมูลได้ทันที อัตราการส่งผ่านข้อมูลทั้งหมด (throughput) ก็จะเพิ่มขึ้นเพียงประมาณ 6 เปอร์เซ็นต์เท่านั้น
  • ขนาดของ RAM ส่งผลโดยตรงต่อความเร็ว การลดขนาด RAM cache ลงครึ่งหนึ่งทำให้อัตราการส่งผ่านข้อมูลลดลงประมาณ 15 เปอร์เซ็นต์ โดย CPU ใช้เวลาในการจัดการกับ cache misses—ทั้งการ de-quantising, การคัดลอก และการจัดการข้อมูล—แทบจะเท่ากับเวลาที่ใช้รอข้อมูลจากดิสก์

ตัวเลขเหล่านี้ล้มล้างความเชื่อทั่วไปที่ว่าแบนด์วิดท์ของหน่วยจัดเก็บข้อมูล (storage bandwidth) คือคอขวดหลักสำหรับการอนุมานโมเดลขนาดใหญ่บนแล็ปท็อป

ทำไม RAM ถึงสำคัญกว่า SSD

เมื่อพารามิเตอร์ของโมเดลไม่ได้อยู่ใน RAM ระบบจะต้อง:

  1. ดึงข้อมูลจาก SSD
  2. ถอดรหัสและย้ายข้อมูลไปยัง CPU registers เพื่อการประมวลผล

ทั้งสองขั้นตอนต้องใช้รอบการทำงาน (cycles) ขั้นตอนแรกถูกจำกัดด้วยแบนด์วิดท์ของ SSD ส่วนขั้นตอนที่สองจะเพิ่มความล่าช้าในระดับที่ใกล้เคียงกัน เนื่องจาก CPU ต้องทำการ de-quantise ข้อมูลไม่ว่าข้อมูลจะมาถึงเร็วแค่ไหนก็ตาม ดังนั้น SSD ที่เร็วขึ้นจึงให้ผลตอบแทนที่ลดน้อยลง (diminishing returns) ในขณะที่การมี RAM มากขึ้นจะช่วยให้โมเดลส่วนใหญ่คงอยู่ในหน่วยความจำและช่วยลดขั้นตอนการรับส่งข้อมูลที่สิ้นเปลืองได้

นัยสำคัญสำหรับนักพัฒนา

  • ลงทุนในหน่วยความจำ ไม่ใช่หน่วยจัดเก็บข้อมูล
  • การทดสอบในเครื่อง (Local testing) กลายเป็นเรื่องที่เป็นไปได้ นักพัฒนาสามารถรันโมเดล MoE แบบ open-weight บนเครื่องที่มีอยู่ เพื่อตรวจสอบสไตล์, พฤติกรรมการเรียกใช้เครื่องมือ (tool-calling) และคุณภาพของผลลัพธ์ โดยไม่ต้องเสียค่าใช้จ่ายสำหรับ cloud credits
  • การประเมินแบบกลุ่ม (Batch evaluation) สามารถทำได้จริง การแชทแบบเรียลไทม์อาจยังรู้สึกหน่วงอยู่บ้าง แต่การทำงานแบบคิว (queued jobs)—เช่น การสร้าง prompt จำนวนมากเพื่อการวิจัย—สามารถรันบนแล็ปท็อปได้อย่างราบรื่น

ข้อโต้แย้งที่อาจเกิดขึ้น

บางคนอาจโต้แย้งว่าความหน่วง (latency) ของ SSD ยังคงมีความสำคัญสำหรับเวิร์กโหลดที่ต้องโหลดน้ำหนักของผู้เชี่ยวชาญ (expert weights) ใหม่ซ้ำๆ

สิ่งที่ควรจับตามองต่อไป

  • โมเดลรุ่นที่ใช้หน่วยความจำอย่างมีประสิทธิภาพ (Memory-efficient model variants)
  • ฮาร์ดแวร์ที่มี on-chip caches ขนาดใหญ่ขึ้น
  • กลยุทธ์การทำ caching ในระดับซอฟต์แวร์

บทสรุปนั้นชัดเจน: นักพัฒนาที่ต้องการทดลองกับโมเดล MoE ขนาดมหึมาบนแล็ปท็อปควรซื้อ RAM เพิ่ม การอัปเกรด SSD ช่วยลดเวลาได้เพียงไม่กี่เปอร์เซ็นต์ ในขณะที่การเพิ่มหน่วยความจำสามารถลดเวลาการอนุมาน (inference time) ได้ถึงหลักสิบเปอร์เซ็นต์ สิ่งนี้เปลี่ยนการคำนวณต้นทุนสำหรับการทำ AI prototyping และเปิดประตูสู่การทดสอบโมเดลในเครื่องโดยไม่มีค่าใช้จ่าย ซึ่งก่อนหน้านี้เคยเชื่อกันว่าต้องใช้คลัสเตอร์คลาวด์เฉพาะทางเท่านั้น