Xiaomi-Robotics-1 พิสูจน์ว่าปริมาณข้อมูลสำคัญกว่าขนาดของโมเดลในด้านหุ่นยนต์

Xiaomi ได้เปิดตัว Xiaomi-Robotics-1 ซึ่งเป็นโมเดลพื้นฐาน (foundation model) ที่สร้างความเปลี่ยนแปลงครั้งสำคัญ โดยเปลี่ยนกระบวนทัศน์ของการฝึกฝนหุ่นยนต์จากการเพิ่มพลังการประมวลผล (compute power) ไปสู่การขยายขนาดข้อมูลมหาศาล (massive data scaling) ด้วยการใช้ประโยชน์จากวิธีการเก็บข้อมูลที่เป็นเอกลักษณ์ โมเดลนี้จึงแสดงให้เห็นถึงความสามารถในการปรับตัวที่เหนือชั้นในสภาพแวดล้อมที่ไม่คุ้นเคยและงานด้านการหยิบจับและจัดการที่ซับซ้อน

ทลายคอขวดด้านข้อมูลด้วยอุปกรณ์หยิบจับแบบพกพา

ความท้าทายหลักในด้านหุ่นยนต์คือ "คอขวดด้านข้อมูล" (data bottleneck) มาโดยตลอด ซึ่งก็คือความยากในการเก็บรวบรวมข้อมูลการปฏิสัมพันธ์ที่มีคุณภาพสูงจำนวนมหาศาลโดยไม่ต้องใช้แขนกลหุ่นยนต์แบบติดตั้งอยู่กับที่ที่มีราคาแพง Xiaomi ก้าวข้ามปัญหานี้ด้วยการใช้อุปกรณ์หยิบจับแบบพกพา (handheld grippers) ที่ติดตั้งกล้อง

แทนที่จะเป็นการเขียนโปรแกรมให้หุ่นยนต์ ผู้ควบคุมที่เป็นมนุษย์ได้ใช้อุปกรณ์พกพาเหล่านี้เพื่อบันทึกงานด้านการหยิบจับและจัดการในสภาพแวดล้อมที่หลากหลายกว่า 1,700 แห่ง รวมถึงห้องครัว สำนักงาน และโรงงาน วิธีการนี้ทำให้ได้ข้อมูลการบันทึกการเคลื่อนไหวมากถึง 100,000 ชั่วโมง และเพื่อแก้ปัญหาเรื่องการติดป้ายกำกับข้อมูล (labeling) Xiaomi ได้ใช้โมเดล AI เพื่อสร้างคำอธิบายข้อความสำหรับแต่ละส่วนของการเคลื่อนไหวโดยอัตโนมัติ ทำให้สามารถติดป้ายกำกับชุดข้อมูลทั้งหมดได้สำเร็จภายในเวลาเพียงสองสัปดาห์

กฎการขยายขนาด (Scaling Law): ข้อมูลสำคัญกว่าการประมวลผล

ข้อมูลเชิงลึกทางเทคนิคที่สำคัญจากการวิจัย Xiaomi-Robotics-1 คือ การมีข้อมูลการฝึกฝนที่มากขึ้นจะช่วยเพิ่มประสิทธิภาพได้สูงกว่าการเพิ่มเพียงขนาดของโมเดลหรือพลังการประมวลผลอย่างมีนัยสำคัญ แม้ว่าโมเดลที่มีขนาดใหญ่ขึ้นจะช่วยลดความผิดพลาดในการทำนายได้จริง แต่อัตราความสำเร็จของหุ่นยนต์ในสภาพแวดล้อมที่ไม่คุ้นเคยกลับพุ่งสูงขึ้นจาก 25% เป็น 75% เมื่อปริมาณข้อมูลการฝึกฝนเพิ่มขึ้น

สิ่งนี้สะท้อนถึงแนวโน้มที่พบในด้าน Computer Vision ซึ่งการเพิ่มข้อมูลให้คุณค่ามากกว่าการเพิ่มจำนวนพารามิเตอร์ สำหรับ Xiaomi นี่หมายความว่าเส้นทางสู่การสร้าง AI สำหรับหุ่นยนต์อเนกประสงค์ (General Purpose Robot AI) ขึ้นอยู่กับความหลากหลายและขนาดของชุดข้อมูล มากกว่าแค่การสร้างโครงข่ายประสาทเทียม (neural networks) ที่ใหญ่ขึ้น

ความสามารถในการปรับตัวและประสิทธิภาพในการทดสอบที่ไม่มีใครเทียบได้

Xiaomi-Robotics-1 ถูกออกแบบมาให้ปฏิบัติตามคำสั่งเสียงหรือคำสั่งเขียน และสามารถปรับตัวเข้ากับงานใหม่ๆ ได้โดยใช้การปรับจูน (fine-tuning) เพียงเล็กน้อย ในการทดสอบ โมเดลได้รับมอบหมายให้ทำภารกิจที่ซับซ้อน เช่น การใส่ผ้าลงในเครื่องซักผ้า การป้อนกระดาษเข้าเครื่องพิมพ์ และการจัดกระเป๋าเดินทาง

ผลลัพธ์ที่ได้นั้นชัดเจน:

  • การปรับตัวที่รวดเร็ว: ด้วยการฝึกฝนเฉพาะงานไม่ถึง 10 ชั่วโมง โมเดลสามารถทำอัตราความสำเร็จได้ถึง 75% ซึ่งเหนือกว่าคู่แข่งอย่าง Physical Intelligence ที่ทำได้เพียง 40% อย่างมีนัยสำคัญ
  • ความเป็นผู้นำใน Benchmark: โมเดลนี้เป็นผู้นำในตารางคะแนน RoboCasa365 ด้วยส่วนต่างที่ทิ้งห่าง โดยเฉพาะในงานแบบผสมผสานที่ไม่เคยเห็นมาก่อน
  • ประสิทธิภาพบน RoboDojo: Xiaomi-Robotics-1 ทำคะแนนได้สูงกว่าอันดับสองใน Benchmark ของ RoboDojo ประมาณ 58%

นอกจากนี้ โมเดลยังแสดงให้เห็นถึงความแข็งแกร่งเป็นพิเศษในการจัดการกับวัสดุที่อ่อนนุ่มและเสียรูปได้ง่าย เช่น กระดาษ ซึ่งเป็นสิ่งที่ระบบหุ่นยนต์แบบแข็ง (rigid robotic systems) ทำได้ยากมาโดยตลอด

ทิศทางใหม่สำหรับอุตสาหกรรมหุ่นยนต์

แนวทางของ Xiaomi กำลังอยู่ในจุดตัดกับยักษ์ใหญ่รายอื่นในอุตสาหกรรม ในขณะที่ Nvidia พยายามเปลี่ยนปัญหาด้านข้อมูลของหุ่นยนต์ให้กลายเป็นปัญหาด้านการประมวลผลผ่านการสร้างข้อมูลสังเคราะห์ (synthetic data generation) และโมเดล Orca ของ BAAI พยายามเรียนรู้จากวิดีโอที่ไม่มีการติดป้ายกำกับ แต่ Xiaomi กลับมุ่งเน้นไปที่ข้อมูลการเคลื่อนไหวที่มีการติดป้ายกำกับขนาดใหญ่และเป็นระบบอัตโนมัติ

ในขณะที่ Xiaomi กำลังเตรียมปล่อยโมเดลและโค้ดบน GitHub และ Hugging Face อุตสาหกรรมกำลังจับตามองอย่างใกล้ชิด การพัฒนานี้บ่งชี้ว่าพรมแดนถัดไปของหุ่นยนต์จะไม่ใช่ชัยชนะของผู้ที่มีชิปที่ทรงพลังที่สุด แต่จะเป็นของผู้ที่มีชุดข้อมูลการเคลื่อนไหวที่หลากหลายและมีการติดป้ายกำกับที่ดีที่สุด

สรุปประเด็นสำคัญ

  • การขยายขนาดโดยเน้นข้อมูลเป็นศูนย์กลาง (Data-Centric Scaling): การเพิ่มปริมาณข้อมูลการฝึกฝนพิสูจน์แล้วว่ามีประสิทธิภาพต่ออัตราความสำเร็จของหุ่นยนต์มากกว่าการเพิ่มขนาดโมเดลหรือพลังการประมวลผล
  • นวัตกรรมการเก็บข้อมูล: อุปกรณ์หยิบจับแบบพกพาช่วยให้ Xiaomi สามารถรวบรวมข้อมูลการเคลื่อนไหวได้ถึง 100,000 ชั่วโมงใน 1,700 สภาพแวดล้อม โดยไม่จำเป็นต้องใช้หุ่นยนต์เฉพาะทาง
  • ความสามารถในการประยุกต์ใช้สูง (High Generalization): โมเดลสามารถทำอัตราความสำเร็จได้ถึง 75% ในงานใหม่ๆ โดยใช้เวลาฝึกฝนเพิ่มเติมไม่ถึง 10 ชั่วโมง