พรมแดนของ Physical AI กำลังเผชิญกับคอขวดครั้งใหญ่ นั่นคือเรายังขาดข้อมูลการฝึกฝนในโลกแห่งความเป็นจริงที่มีความแม่นยำสูง (high-fidelity) ในขณะที่ Large Language Models เติบโตจากการดึงข้อมูลข้อความจากอินเทอร์เน็ต แต่หุ่นยนต์กลับต้องการแนวทางที่มีต้นทุนสูงกว่ามาก

ปัญหาความขาดแคลนข้อมูลในด้านหุ่นยนต์

เพื่อให้หุ่นยนต์ฮิวแมนนอยด์และหุ่นยนต์ในคลังสินค้ามีความคล่องแคล่วเทียบเท่ามนุษย์ พวกมันจำเป็นต้องมีขนาดข้อมูลที่ในปัจจุบันยังไม่มีอยู่จริง Vineeth Velmurugan หัวหน้าฝ่ายการเรียนรู้ของหุ่นยนต์ (head of robot learning) ของ Encord และอดีตผู้เชี่ยวชาญจากห้องปฏิบัติการหุ่นยนต์ของ OpenAI กล่าวว่า การจะก้าวข้ามขีดจำกัดนี้ได้จำเป็นต้องมีชุดข้อมูลที่มีขนาดใหญ่กว่าคลังวิดีโอทั้งหมดของ YouTube ถึงประมาณห้าเท่า

ข้อความนั้นมีอยู่อย่างมหาศาลและสามารถดึงข้อมูล (scrape) ได้ฟรี แต่ข้อมูลทางกายภาพ (physical data) นั้นต้องถูก "ผลิต" ขึ้นมา การฝึกฝนจากวิดีโอเพียงอย่างเดียวมักจะขาดความแม่นยำที่จำเป็นสำหรับการควบคุมที่ซับซ้อน ด้วยเหตุนี้ อุตสาหกรรมจึงเปลี่ยนจากการปรับแต่งสถาปัตยกรรมโมเดล (model architecture) ไปสู่การแก้ปัญหาที่ยากกว่ามาก นั่นคือการผลิตข้อมูลทางกายภาพที่มีคุณภาพสูงและมีการกำกับข้อมูล (annotated) อย่างละเอียด

เหนือกว่าวิดีโอ: การใช้คลื่นสมองและสัญญาณกล้ามเนื้อ

สตาร์ทอัพอย่าง Encord กำลังทดสอบรูปแบบข้อมูล (data modalities) ใหม่ๆ เพื่อให้หุ่นยนต์เข้าใจบริบทที่ลึกซึ้งยิ่งขึ้น ในโครงการนำร่องร่วมกับ Zander Labs สตาร์ทอัพด้านประสาทวิทยาจากเยอรมนี Encord ได้ติดตั้งชุดหูฟังตรวจคลื่นสมองให้กับผู้ควบคุม ด้วยการวัดกิจกรรมของระบบประสาท นักวิจัยหวังว่าจะสามารถอนุมานถึงความตั้งใจ ความผิดพลาด และความประหลาดใจได้

Lucas Gehrke นักประสาทวิทยาที่ Zander กล่าวว่า การติดตามกิจกรรมของสมองช่วยให้ผู้สร้างโมเดลทราบได้อย่างแม่นยำว่าเมื่อใดที่หุ่นยนต์ควรเรียกใช้โมเดลการคำนวณที่มีประสิทธิภาพสูงสุดสำหรับงานที่ยากลำบาก

Encord ยังสำรวจเรื่องอื่นๆ อีก เช่น:

  • Electromyography (EMG): เซนเซอร์ที่รัดไว้ที่แขนท่อนล่างจะจับสัญญาณไฟฟ้าในกล้ามเนื้อ สร้างแผนที่การเคลื่อนไหวของมือแบบ 3 มิติ ซึ่งกล้องที่ติดบนศีรษะมักจะมองไม่เห็น
  • **Leader-

การเพิ่มคลื่นสมองและสัญญาณกล้ามเนื้อ

โครงการนำร่อง Encord-Zander พยายามเติมเต็มช่องว่างนั้นด้วยการเพิ่มสัญญาณทางสรีรวิทยาเข้าไปในบันทึกภาพ ผู้ปฏิบัติงานจะสวมชุดหูฟังที่อ่านค่า electroencephalography (EEG) หรือกิจกรรมทางไฟฟ้าของสมอง ในขณะที่เซนเซอร์ EMG บนแขนท่อนล่างจะตรวจจับแรงกระตุ้นของกล้ามเนื้อ เป้าหมายคือเพื่ออนุมานสภาวะทางจิตใจ เช่น ความตั้งใจ ความประหลาดใจ หรือความผิดพลาด และเพื่อเปลี่ยนกิจกรรมของกล้ามเนื้อดิบให้เป็นแผนที่การเคลื่อนไหวของมือแบบสามมิติ ซึ่งวิดีโอเพียงอย่างเดียวไม่สามารถทำได้

Lucas Gehrke นักประสาทวิทยาที่ Zander อธิบายว่า การรู้ว่ามนุษย์คาดการณ์งานย่อยที่ยากลำบาก เมื่อใด จะช่วยให้หุ่นยนต์สามารถจัดสรรโมเดลการคำนวณที่มีประสิทธิภาพสูงสุดได้ในจังหวะที่เหมาะสม

นอกเหนือจากข้อมูลทางประสาท (neuro-data) แล้ว Encord ยังทดสอบเทคนิคเสริมอื่นๆ อีกหลายอย่าง:

  • Electromyography (EMG): เซนเซอร์บนแขนท่อนล่างจะแสดงผลการทำงานของกล้ามเนื้อแบบเรียลไทม์ ช่วยให้สามารถสร้างเส้นทางการเคลื่อนที่ของนิ้วมือได้อย่างแม่นยำ ซึ่งกล้องที่ติดบนศีรษะมักจะมองไม่เห็น
  • Leader-follower rigs: แขนกลคู่หนึ่งทำงานประสานกัน โดยแขนหนึ่งจะเลียนแบบการเคลื่อนไหวของผู้ปฏิบัติงานที่เป็นมนุษย์ วิธีนี้ช่วยบันทึกงานที่ละเอียดอ่อน เช่น การเทของเหลว หรือการวางซ้อนชิป ซึ่งความผิดพลาดในระดับมิลลิเมตรนั้นมีความสำคัญมาก
  • Dense annotation: แทนที่จะติดป้ายกำกับเฉพาะการกระทำในระดับสูง ทีมของ Velmurugan จะแนบคำอธิบายที่มีความละเอียดสูง เช่น “มือขวาขันน็อตให้แน่นขึ้น” เขาประเมินว่ารายละเอียดนี้มีค่ามากกว่าวิดีโอแบบ ego-centric ดิบๆ ถึงประมาณ 100 เท่า ในการฝึกทักษะการจัดการ (manipulation skill) เฉพาะทาง

เศรษฐศาสตร์ของการผลิตข้อมูล

Physical AI เปลี่ยนการคำนวณทางการเงินของการเรียนรู้ของเครื่อง (machine learning) ห้องปฏิบัติการ LLM สร้างโมเดลด้วยต้นทุนส่วนเพิ่มที่เกือบเป็นศูนย์เพราะอินเทอร์เน็ตมีข้อความให้ใช้ไม่จำกัด อย่างไรก็ตาม การผลิตข้อมูลสำหรับฝึกหุ่นยนต์จำเป็นต้องใช้ฮาร์ดแวร์ ผู้ปฏิบัติงานที่เป็นมนุษย์ และการทำ annotation ที่พิถีพิถัน เป้าหมายภายในของ Encord คือการทำให้ข้อมูลคุณภาพสูงมีประสิทธิภาพด้านต้นทุนมากกว่ามูลค่าที่ส่งมอบให้ลูกค้าถึง 20 เท่า แต่ถึงแม้ประสิทธิภาพที่ดุดันขนาดนั้น ก็ยังคงหมายถึงโครงการมูลค่าหลายล้านดอลลาร์สำหรับฝูงหุ่นยนต์ขนาดใหญ่

เดิมพันนั้นชัดเจน: บริษัทที่สามารถสร้างชุดข้อมูลขนาดใหญ่ที่มีการทำ annotation อย่างเข้มข้นได้ก่อน จะเป็นผู้ครองตลาดที่กำลังเติบโตของการควบคุมจัดการแบบอัตโนมัติ (autonomous manipulation) ไม่ว่าจะเป็นการเสียบสาย Ethernet บนพื้นห้องดาต้าเซ็นเตอร์ หรือการหยิบและบรรจุสินค้าในศูนย์กระจายสินค้า ส่วนบริษัทที่ยังคงพึ่งพาเพียงแค่กระบวนการวิดีโอ (video-only pipelines) เสี่ยงที่จะล้าหลังในขณะที่คู่แข่งสามารถดึงสัญญาณที่เข้มข้นกว่ามาจากร่างกายและสมองของมนุษย์

ข้อโต้แย้งและคำถามที่ยังไม่มีคำตอบ

ไม่ใช่ทุกคนที่เชื่อว่าสัญญาณประสาทคือจิ๊กซอว์ที่ขาดหายไป นักวิจารณ์โต้แย้งว่าความซับซ้อนของฮาร์ดแวร์ที่เพิ่มขึ้นอาจไม่คุ้มกับประโยชน์ที่ได้รับ โดยเฉพาะอย่างยิ่งเมื่อวิดีโอรวมกับเซนเซอร์วัดแรงบิดและแรงกด (force-torque sensors) สามารถให้ประสิทธิภาพที่น่าพอใจสำหรับงานอุตสาหกรรมหลายอย่างอยู่แล้ว ความสามารถในการขยายขนาด (Scalability) เป็นอีกหนึ่งข้อกังวล: การติดตั้งชุดหูฟัง EEG และอุปกรณ์ EMG ให้กับผู้ปฏิบัติงานหลายพันคนอาจเป็นเรื่องที่เกินกำลังสำหรับผู้ผลิตรายเล็ก

กระบวนการผลิตข้อมูลยังคงต้องใช้แรงงานอย่างหนัก แม้จะมีอุปกรณ์แบบ leader-follower แต่การบันทึกขอบเขตของงานที่จำเป็นสำหรับหุ่นยนต์ที่มีความสามารถทั่วไป (general robot) อย่างแท้จริง จะต้องอาศัยความพยายามที่ต่อเนื่องและมีการประสานงานกันระหว่างห้องปฏิบัติการและโรงงานหลายแห่ง ตลาดจะต้องตัดสินใจว่าประสิทธิภาพที่เพิ่มขึ้นทีละน้อยนั้นคุ้มค่ากับการลงทุนล่วงหน้าหรือไม่

สิ่งที่ต้องจับตามองต่อไป

  • หมุดหมายของปริมาณข้อมูล: คำกล่าวอ้างของ Encord ที่ว่ามีชุดข้อมูลขนาดใหญ่กว่า YouTube ถึงห้าเท่าจะเป็นเกณฑ์มาตรฐานที่เป็นรูปธรรม เมื่อมีการเปิดเผยข้อมูล ผู้เล่นรายอื่นจะมีเป้าหมายที่ชัดเจนในการทำตามหรือทำให้เหนือกว่า
  • อัตราการนำฮาร์ดแวร์มาใช้: ความเร็วที่อุปกรณ์ EEG และ EMG จะกลายเป็นมาตรฐานในอุปกรณ์เก็บข้อมูล จะเป็นตัวบ่งชี้ว่าแนวทางนี้สามารถขยายขนาดไปไกลกว่าโครงการนำร่องเชิงทดลองได้หรือไม่
  • ตัวชี้วัดด้านต้นทุน: หาก Encord สามารถแสดงให้เห็นถึงความได้เปรียบด้านต้นทุน 20 เท่าตามที่สัญญาไว้ได้จริง มันอาจกระตุ้นให้เกิดคลื่นผู้เล่นรายใหม่ที่มุ่งเน้นไปที่ “การผลิตข้อมูล” (data manufacturing) มากกว่าการออกแบบโมเดล
  • ช่องว่างด้านประสิทธิภาพ