مدل‌های RT-2 از Google DeepMind، OpenVLA از Stanford-Toyota، GR00T از NVIDIA، LeRobot از Hugging Face و Pi-Zero از Physical Intelligence به ربات‌ها این توانایی را می‌دهند که ورودی‌های بصری، دستورات زبانی و اقدامات حرکتی را در یک مدل واحد به هم پیوند دهند. این قابلیت، توالی مراحل کدنویسی‌شده دستی را با رفتار «ببین و انجام بده» جایگزین می‌کند که نویدبخش توسعه سریع‌تر و دسترسی گسترده‌تر به حوزه رباتیک است.

چرا مدل‌های بینایی-زبان-عمل (VLA) اهمیت دارند

در بیشتر طول تاریخ رباتیک، مهندسان اسکریپت‌های صریحی می‌نوشتند که به ربات درباره هر حرکت مفصل دستور می‌داد. نسل جدید مدل‌های بینایی-زبان-عمل (VLA)، با ربات مانند یک عامل گفتگو‌محور برخورد می‌کند: یک دوربین تصویر را پخش می‌کند، کاربر درخواستی را می‌گوید یا تایپ می‌کند و مدل دستورات حرکتی لازم برای اجرای آن را ارائه می‌دهد.

پنج مدل پیشرو در این حوزه

  • RT-2 (Google DeepMind) – جریان‌های بصری خام را به زبان انسانی متصل می‌کند و به ربات اجازه می‌دهد آنچه را می‌بیند توصیف کرده و بر اساس دستورات صوتی عمل کند.
  • OpenVLA (Stanford + Toyota) – یک نسخه متن‌باز است که به هر توسعه‌دهنده‌ای اجازه می‌دهد مدل را به سخت‌افزار خود متصل کند.
  • GR00T (NVIDIA) – برای پلتفرم‌های انسان‌نما ساخته شده است؛ این مدل درباره صحنه استدلال کرده و دستورات حرکتی سطح پایین تولید می‌کند.
  • LeRobot (Hugging Face) – یک مخزن داده و مجموعه‌ای از ابزارها را فراهم می‌کند که سرعت آموزش مدل و یکپارچه‌سازی را برای توسعه‌دهندگان ربات افزایش می‌دهد.
  • Pi-Zero (Physical Intelligence) – بیان می‌کند که یک «مغز» واحد می‌تواند در بدن‌های مختلف ربات‌ها مجدداً استفاده شود، که این امر پشته‌های نرم‌افزاری را برای سخت‌افزارهای متنوع ساده می‌کند.

داده‌ها، شبیه‌سازی و مشکل انحراف (Drift)

هر پنج مدل بر مجموعه‌داده‌های عظیم تکیه دارند که بیشتر آن‌ها از محیط‌های شبیه‌سازی‌شده به‌دست آمده‌اند، زیرا جمع‌آوری داده در دنیای واقعی هزینه‌بر و پرخطر است. این اتکا باعث ایجاد یک «انحراف از شبیه‌سازی به واقعیت» (sim-to-real drift) می‌شود: رفتارهایی که در دنیای مجازی بی‌نقص آموخته شده‌اند، ممکن است هنگام مواجهه با حسگرهای دارای نویز، نورپردازی نامناسب یا موانع غیرمنتظره دچار خطا شوند.