โมเดลโลก Orca จากจีน มีประสิทธิภาพเทียบเท่าหุ่นยนต์เฉพาะทางโดยไม่ต้องใช้ป้ายกำกับการกระทำ (Action Labels)

ความก้าวหน้าครั้งสำคัญจากนักวิจัยในจีนกำลังท้าทายคำนิยามพื้นฐานของความฉลาดของ AI โดยการพิสูจน์ว่าโมเดลโลก (world model) แบบรวมศูนย์สามารถเชี่ยวชาญด้านหุ่นยนต์ได้โดยไม่ต้องมีการควบคุมดูแลโดยตรง โมเดล Orca แสดงให้เห็นว่าเพียงแค่การสังเกตการเปลี่ยนแปลงของโลกผ่านวิดีโอ AI ก็สามารถพัฒนาความเข้าใจภายในที่ลึกซึ้งจนสามารถขับเคลื่อนการกระทำทางกายภาพที่ซับซ้อนได้

กลไกการเรียนรู้แบบคู่: โหมดการเรียนรู้แบบไม่รู้ตัว (Unconscious) และแบบรู้ตัว (Conscious)

Orca แตกต่างจากโมเดลเฉพาะทางแบบดั้งเดิม โดยการใช้แนวทางการฝึกฝนแบบสองทางเพื่อสร้าง "สถานะของโลก" (world state) ภายในขึ้นมา วิธีแรกคือ "การเรียนรู้แบบไม่รู้ตัว" (unconscious learning) ซึ่งเกี่ยวข้องกับการประมวลผลวิดีโอที่ไม่มีป้ายกำกับจำนวน 125,000 ชั่วโมง ในช่วงนี้ โมเดลจะทำนายเฟรมในอนาคตในพื้นที่เชิงนามธรรม ช่วยให้มันสามารถเข้าใจรูปแบบการเคลื่อนไหว การบดบังของวัตถุ และพลวัตของฉากได้โดยไม่จำเป็นต้องมีคำบรรยายแม้แต่คำเดียว

วิธีที่สองคือ "การเรียนรู้แบบรู้ตัว" (conscious learning) ซึ่งมีการนำคำสั่งและคำบรรยายด้วยเสียงเข้ามาใช้ โดยการแบ่งส่วนวิดีโอและติดป้ายกำกับความเปลี่ยนแปลงของสถานะที่เกิดขึ้น Orca จะเรียนรู้ความสัมพันธ์เชิงเหตุและผลระหว่างการกระทำเฉพาะอย่างและผลลัพธ์ทางกายภาพ การผสมผสานนี้ช่วยให้โมเดลสามารถเชื่อมช่องว่างระหว่างการรับรู้ทางสายตาแบบดิบ (raw visual perception) และการใช้เหตุผลทางภาษาในระดับสูงได้

แกนกลางที่คงที่ (Frozen Core) พร้อมโมดูลอัจฉริยะที่สลับเปลี่ยนได้

สถาปัตยกรรมของ Orca ถูกออกแบบมาเพื่อความอเนกประสงค์อย่างสูงสุด โดยใช้โมเดลภาษาและภาพ Qwen3.5 ที่ผ่านการฝึกฝนมาล่วงหน้าเป็น "แกนกลางที่คงที่" (frozen core) แทนที่จะต้องฝึกฝนระบบทั้งหมดใหม่สำหรับทุกงาน นักวิจัยจึงใช้วิธีการต่อ "ส่วนหัว" (heads) ที่มีน้ำหนักเบาและมีความเชี่ยวชาญเฉพาะด้านเข้ากับฐานรากที่มั่นคงนี้:

  • การแสดงผลข้อความ: ใช้ส่วนหัวภาษา Qwen3.5 ที่มีอยู่เดิม
  • การสร้างรูปภาพ: ใช้ตัวปรับแต่ง (adapters) ขนาดเล็กที่เชื่อมต่อกับ Stable Diffusion 3.5 เพื่อแปลงสถานะของโลกภายในให้เป็นการทำนายเชิงภาพ
  • การควบคุมหุ่นยนต์: ใช้โมดูล "Action Expert" ที่สร้างขึ้นโดยเฉพาะ ซึ่งได้รับการฝึกฝนมาเพื่อแปลงสถานะของโลกให้เป็นการเคลื่อนไหวทางกายภาพ

ความสามารถในการปรับเปลี่ยนเป็นโมดูลนี้ช่วยให้มั่นใจได้ว่าความเข้าใจส่วนกลางเกี่ยวกับโลกจะยังคงสอดคล้องกัน ไม่ว่าโมเดลจะกำลังตอบคำถาม สร้างวิดีโอ หรือควบคุมแขนกลก็ตาม

มีประสิทธิภาพเหนือกว่าโมเดลเฉพาะทางและโมเดลยักษ์ใหญ่

ตัวชี้วัดประสิทธิภาพของ Orca-4B นั้นมีความสำคัญอย่างยิ่ง ในการทดสอบมาตรฐานวิดีโอแบบใช้ข้อความ (text-based video benchmarks) Orca-4B ทำคะแนนเฉลี่ยได้ 51.8 เปอร์เซ็นต์ ซึ่งเหนือกว่าโมเดลที่มีขนาดใหญ่กว่ามากอย่าง Emu3 (34B) และโมเดล VLM เฉพาะทางอย่าง DeepSeek-VL2-3B ส่วนในงานทำนายรูปภาพผ่านเกณฑ์มาตรฐาน PRICE-V0.1 นั้น Orca-4B ทำคะแนนได้ 59.8 เปอร์เซ็นต์ ซึ่งแซงหน้าเครื่องมือสร้างภาพระดับไฮเอนด์อย่าง FLUX.2 small

สิ่งที่น่าประทับใจที่สุดคือ Orca แสดงให้เห็นถึงประสิทธิภาพที่เทียบเท่ากับ $\pi$0.5 ซึ่งเป็นระบบที่สร้างขึ้นจากข้อมูลการกระทำของหุ่นยนต์โดยเฉพาะ ในงานควบคุมวัตถุ (manipulation tasks) 5 ประเภท เช่น การวางชามซ้อนกันและการตักน้ำตาล ที่สำคัญคือ Orca ทำได้โดยไม่เคยเห็นป้ายกำกับการกระทำ (action label) เลยในช่วงการฝึกฝนล่วงหน้า (pre-training) มหาศาล นอกจากนี้ยังแสดงให้เห็นถึงความสามารถในการกู้คืนข้อผิดพลาด (error recovery) ที่เหนือกว่า โดยสามารถพยายามจับวัตถุใหม่เมื่อการจับครั้งแรกล้มเหลว ในขณะที่โมเดลเฉพาะทางมักจะติดอยู่ในลูปการทำงานซ้ำๆ

ทำไมเรื่องนี้จึงสำคัญต่ออนาคตของ AI

Orca ช่วยแก้ปัญหาคอขวดที่สำคัญที่สุดอย่างหนึ่งในด้านหุ่นยนต์สมัยใหม่ นั่นคือการขาดแคลนข้อมูลการกระทำที่มีป้ายกำกับอย่างเรื้อรัง การพิสูจน์ว่า AI สามารถเรียนรู้ "ฟิสิกส์ของโลก" ผ่านการสังเกตแบบตั้งรับ (passive observation) ได้นั้น งานวิจัยนี้ได้ปูทางไปสู่หุ่นยนต์อเนกประสงค์ที่สามารถนำไปใช้งานในสภาพแวดล้อมใหม่ๆ ได้ โดยไม่จำเป็นต้องใช้ข้อมูลการควบคุมระยะไกล (teleoperation) ที่ต้องใช้มนุษย์มานั่งติดป้ายกำกับด้วยมือเป็นเวลาหลายล้านชั่วโมง

สรุปประเด็นสำคัญ

  • รากฐานแบบไม่มีผู้ควบคุม (Unsupervised Foundation): Orca เรียนรู้พลวัตของโลกผ่าน "การเรียนรู้แบบไม่รู้ตัว" จากวิดีโอที่ไม่มีป้ายกำกับ ช่วยลดการพึ่งพาชุดข้อมูลที่ต้องใช้มนุษย์มาทำเครื่องหมายซึ่งมีต้นทุนสูง
  • สถาปัตยกรรมแบบโมดูล: การใช้แกนกลาง Qwen3.5 ที่คงที่ร่วมกับตัวปรับแต่งที่สลับเปลี่ยนได้ ช่วยให้โมเดลเดียวสามารถมีความเชี่ยวชาญทั้งด้านข้อความ รูปภาพ และการควบคุมหุ่นยนต์ได้พร้อมกัน
  • ประสิทธิภาพเทียบเท่าหุ่นยนต์: Orca-4B มีประสิทธิภาพเทียบเท่ากับระบบหุ่นยนต์เฉพาะทางในงานควบคุมวัตถุ แม้ว่าจะไม่เคยได้รับข้อมูลป้ายกำกับการกระทำมาก่อนในช่วงการฝึกฝนล่วงหน้าก็ตาม