مدل دنیای Orca چین، بدون برچسب‌های عملیاتی با رباتیک تخصصی برابری می‌کند

یک پیشرفت بزرگ توسط محققان چینی، با اثبات اینکه یک مدل دنیای واحد می‌تواند بدون نظارت مستقیم بر رباتیک تسلط یابد، تعریف بنیادی هوش مصنوعی را به چالش می‌کشد. مدل Orca نشان می‌دهد که یک هوش مصنوعی تنها با مشاهده چگونگی تغییر جهان از طریق ویدیو، می‌تواند درک درونی عمیقی ایجاد کند که قادر به هدایت اقدامات فیزیکی پیچیده باشد.

موتور یادگیری دوگانه: حالت‌های ناخودآگاه و خودآگاه

Orca با استفاده از یک رویکرد آموزشی دو جانبه برای ساخت «وضعیت دنیای» داخلی خود، از مدل‌های تخصصی سنتی فاصله می‌گیرد. روش اول، «یادگیری ناخودآگاه»، شامل پردازش ۱۲۵,۰۰۰ ساعت ویدیو بدون برچسب است. در این مرحله، مدل فریم‌های آینده را در یک فضای انتزاعی پیش‌بینی می‌کند که به آن اجازه می‌دهد الگوهای حرکتی، انسداد اشیاء و پویایی صحنه را بدون نیاز به حتی یک زیرنویس درک کند.

روش دوم، «یادگیری خودآگاه»، دستورالعمل‌ها و توضیحات کلامی را معرفی می‌کند. Orca با بخش‌بندی ویدیوها و برچسب‌گذاری تغییرات وضعیت حاصل، رابطه علی و معلولی بین یک اقدام خاص و نتیجه فیزیکی آن را می‌آموزد. این ترکیب به مدل اجازه می‌دهد تا شکاف بین ادراک بصری خام و استدلال زبانی سطح بالا را پر کند.

یک هسته منجمد با ماژول‌های هوش قابل تعویض

معماری Orca برای تطبیق‌پذیری بسیار بالا طراحی شده است. این مدل از مدل زبانی-تصویری پیش‌آموزش‌دیده Qwen3.5 به عنوان یک «هسته منجمد» استفاده می‌کند. محققان به جای بازآموزی کل سیستم برای هر وظیفه، «سر»های (heads) سبک‌وزن و تخصصی را به این پایه پایدار متصل می‌کنند:

  • خروجی متن: از سر زبانی موجود Qwen3.5 استفاده می‌کند.
  • تولید تصویر: از آداپتورهای کوچکی متصل به Stable Diffusion 3.5 برای تبدیل وضعیت دنیای داخلی به پیش‌بینی‌های بصری استفاده می‌کند.
  • کنترل ربات: از یک ماژول اختصاصی ساخته شده به نام "Action Expert" استفاده می‌کند که به‌طور ویژه برای تبدیل وضعیت‌های جهان به حرکات فیزیکی آموزش دیده است.

این ماژولار بودن تضمین می‌کند که درک مرکزی از جهان ثابت باقی بماند، خواه مدل در حال پاسخ دادن به یک سوال باشد، خواه در حال تولید ویدیو یا کنترل یک بازوی مکانیکی.

عملکرد بهتر نسبت به مدل‌های تخصصی و غول‌ها

معیارهای عملکرد Orca-4B قابل توجه است. در بنچمارک‌های ویدیویی مبتنی بر متن، Orca-4B به میانگین ۵۱.۸ درصد دست یافت که از مدل‌های بسیار بزرگتری مانند Emu3 (34B) و مدل‌های VLM تخصصی مانند DeepSeek-VL2-3B پیشی گرفته است. در وظایف پیش‌بینی تصویر از طریق بنچمارک PRICE-V0.1، مدل Orca-4B امتیاز ۵۹.۸ درصد را کسب کرد و از مولدهای سطح بالایی مانند FLUX.2 small فراتر رفت.

از همه چشمگیرتر اینکه Orca در پنج وظیفه دست‌ورزی (manipulation)، مانند چیدن کاسه‌ها و قاشق زدن شکر، با $\pi$0.5 — سیستمی که منحصراً بر اساس داده‌های عملیاتی رباتیک ساخته شده است — برابری می‌کند. نکته حیاتی این است که Orca بدون دیدن حتی یک برچسب عملیاتی در طول مرحله پیش‌آموزش عظیم خود، به این موفقیت دست یافت. این مدل حتی بازیابی خطای برتری را نشان داد و در مواردی که مدل‌های تخصصی اغلب در حلقه‌های تکراری گیر می‌کردند، تلاش‌های ناموفق برای گرفتن اشیاء را دوباره امتحان می‌کرد.

چرا این موضوع برای آینده هوش مصنوعی اهمیت دارد

Orca یکی از مهم‌ترین گلوگاه‌های رباتیک مدرن را حل می‌کند: کمبود مزمن داده‌های عملیاتی برچسب‌گذاری شده. این تحقیق با اثبات اینکه یک هوش مصنوعی می‌تواند «فیزیک جهان» را از طریق مشاهده غیرفعال بیاموزد، راه را برای ربات‌های همه‌منظوره هموار می‌کند که می‌توانند بدون نیاز به میلیون‌ها ساعت داده‌های عملیاتی دستی و برچسب‌گذاری شده، در محیط‌های جدید مستقر شوند.

نکات کلیدی

  • پایه بدون نظارت: Orca پویایی‌های جهان را از طریق «یادگیری ناخودآگاه» ویدیوهای بدون برچسب می‌آموزد و وابستگی به مجموعه‌داده‌های گران‌قیمت با حاشیه‌نویسی انسانی را کاهش می‌دهد.
  • معماری ماژولار: استفاده از هسته منجمد Qwen3.5 با آداپتورهای قابل تعویض به یک مدل اجازه می‌دهد تا به‌طور همزمان در متن، تصویر و کنترل رباتیک برتری داشته باشد.
  • برابری رباتیک: Orca-4B با وجود عدم مواجهه قبلی با برچسب‌های عملیاتی در طول پیش‌آموزش، عملکرد سیستم‌های رباتیک تخصصی را در وظایف دست‌ورزی برابری می‌کند.