Model Dunia Orca dari Tiongkok Menandingi Robotika Khusus Tanpa Label Aksi

Sebuah terobosan dari para peneliti di Tiongkok tengah menantang definisi mendasar tentang kecerdasan AI dengan membuktikan bahwa model dunia yang terpadu dapat menguasai robotika tanpa pengawasan langsung. Model Orca menunjukkan bahwa hanya dengan mengamati bagaimana dunia berubah melalui video, sebuah AI dapat mengembangkan pemahaman internal yang mendalam yang mampu menggerakkan tindakan fisik yang kompleks.

Mesin Pembelajaran Ganda: Mode Tidak Sadar dan Sadar

Orca berbeda dari model khusus tradisional dengan menggunakan pendekatan pelatihan dua cabang untuk membangun "keadaan dunia" (world state) internalnya. Metode pertama, "pembelajaran tidak sadar" (unconscious learning), melibatkan pemrosesan 125.000 jam video tanpa label. Selama fase ini, model memprediksi bingkai (frame) masa depan dalam ruang abstrak, yang memungkinkannya memahami pola gerakan, oklusi objek, dan dinamika pemandangan tanpa memerlukan satu pun keterangan (caption).

Metode kedua, "pembelajaran sadar" (conscious learning), memperkenalkan instruksi dan deskripsi verbal. Dengan menyegmentasi video dan melabeli perubahan keadaan yang dihasilkan, Orca mempelajari hubungan kausal antara tindakan tertentu dan hasil fisiknya. Kombinasi ini memungkinkan model untuk menjembatani kesenjangan antara persepsi visual mentah dan penalaran linguistik tingkat tinggi.

Inti yang Beku dengan Modul Kecerdasan yang Dapat Ditukar

Arsitektur Orca dirancang untuk fleksibilitas ekstrem. Ia menggunakan model bahasa-gambar Qwen3.5 yang telah dilatih sebelumnya sebagai "inti yang beku" (frozen core). Alih-alih melatih ulang seluruh sistem untuk setiap tugas, para peneliti memasangkan "kepala" (heads) ringan yang khusus ke fondasi yang stabil ini:

  • Output Teks: Menggunakan kepala bahasa Qwen3.5 yang sudah ada.
  • Generasi Gambar: Menggunakan adaptor kecil yang terhubung ke Stable Diffusion 3.5 untuk menerjemahkan keadaan dunia internal menjadi prediksi visual.
  • Kontrol Robot: Menggunakan modul "Action Expert" buatan khusus yang dilatih secara spesifik untuk mengubah keadaan dunia menjadi gerakan fisik.

Modularitas ini memastikan bahwa pemahaman sentral tentang dunia tetap konsisten, baik saat model menjawab pertanyaan, menghasilkan video, atau mengendalikan lengan mekanik.

Mengungguli Model Khusus dan Raksasa AI

Metrik performa untuk Orca-4B sangat signifikan. Pada tolok ukur (benchmark) video berbasis teks, Orca-4B mencapai rata-rata 51,8 persen, mengungguli model yang jauh lebih besar seperti Emu3 (34B) dan VLM khusus seperti DeepSeek-VL2-3B. Dalam tugas prediksi gambar melalui benchmark PRICE-V0.1, Orca-4B mencetak skor 59,8 persen, melampaui generator kelas atas seperti FLUX.2 small.

Yang paling mengesankan, Orca menunjukkan kesetaraan dengan $\pi$0.5—sebuah sistem yang dibangun secara eksklusif pada data aksi robotik—di lima tugas manipulasi, seperti menumpuk mangkuk dan menyendok gula. Yang terpenting, Orca mencapai hal ini tanpa pernah melihat label aksi selama fase pra-pelatihan masifnya. Ia bahkan menunjukkan pemulihan kesalahan (error recovery) yang unggul, mencoba kembali genggaman yang gagal di mana model khusus sering kali terjebak dalam loop yang berulang.

Mengapa Ini Penting bagi Masa Depan AI

Orca memecahkan salah satu hambatan paling signifikan dalam robotika modern: kekurangan kronis data aksi berlabel. Dengan membuktikan bahwa AI dapat mempelajari "fisika dunia" melalui observasi pasif, penelitian ini membuka jalan bagi robot serbaguna yang dapat diterapkan di lingkungan baru tanpa memerlukan jutaan jam data teleoperasi yang dilabeli secara manual.

Poin-Poin Penting

  • Fondasi Tanpa Pengawasan: Orca mempelajari dinamika dunia melalui "pembelajaran tidak sadar" dari video tanpa label, mengurangi ketergantungan pada dataset anotasi manusia yang mahal.
  • Arsitektur Modular: Penggunaan inti Qwen3.5 yang beku dengan adaptor yang dapat ditukar memungkinkan satu model untuk unggul dalam teks, gambar, dan kontrol robotik secara bersamaan.
  • Kesetaraan Robotik: Orca-4B menandingi performa sistem robotika khusus dalam tugas manipulasi meskipun tidak memiliki paparan label aksi sebelumnya selama pra-pelatihan.