مدلهای RT-2 از Google DeepMind، OpenVLA از Stanford-Toyota، GR00T از NVIDIA، LeRobot از Hugging Face و Pi-Zero از Physical Intelligence به رباتها این توانایی را میدهند که ورودیهای بصری، دستورات زبانی و اقدامات حرکتی را در یک مدل واحد به هم پیوند دهند. این قابلیت، توالی مراحل کدنویسیشده دستی را با رفتار «ببین و انجام بده» جایگزین میکند که نویدبخش توسعه سریعتر و دسترسی گستردهتر به حوزه رباتیک است.
چرا مدلهای بینایی-زبان-عمل (VLA) اهمیت دارند
در بیشتر طول تاریخ رباتیک، مهندسان اسکریپتهای صریحی مینوشتند که به ربات درباره هر حرکت مفصل دستور میداد. نسل جدید مدلهای بینایی-زبان-عمل (VLA)، با ربات مانند یک عامل گفتگومحور برخورد میکند: یک دوربین تصویر را پخش میکند، کاربر درخواستی را میگوید یا تایپ میکند و مدل دستورات حرکتی لازم برای اجرای آن را ارائه میدهد.
پنج مدل پیشرو در این حوزه
- RT-2 (Google DeepMind) – جریانهای بصری خام را به زبان انسانی متصل میکند و به ربات اجازه میدهد آنچه را میبیند توصیف کرده و بر اساس دستورات صوتی عمل کند.
- OpenVLA (Stanford + Toyota) – یک نسخه متنباز است که به هر توسعهدهندهای اجازه میدهد مدل را به سختافزار خود متصل کند.
- GR00T (NVIDIA) – برای پلتفرمهای انساننما ساخته شده است؛ این مدل درباره صحنه استدلال کرده و دستورات حرکتی سطح پایین تولید میکند.
- LeRobot (Hugging Face) – یک مخزن داده و مجموعهای از ابزارها را فراهم میکند که سرعت آموزش مدل و یکپارچهسازی را برای توسعهدهندگان ربات افزایش میدهد.
- Pi-Zero (Physical Intelligence) – بیان میکند که یک «مغز» واحد میتواند در بدنهای مختلف رباتها مجدداً استفاده شود، که این امر پشتههای نرمافزاری را برای سختافزارهای متنوع ساده میکند.
دادهها، شبیهسازی و مشکل انحراف (Drift)
هر پنج مدل بر مجموعهدادههای عظیم تکیه دارند که بیشتر آنها از محیطهای شبیهسازیشده بهدست آمدهاند، زیرا جمعآوری داده در دنیای واقعی هزینهبر و پرخطر است. این اتکا باعث ایجاد یک «انحراف از شبیهسازی به واقعیت» (sim-to-real drift) میشود: رفتارهایی که در دنیای مجازی بینقص آموخته شدهاند، ممکن است هنگام مواجهه با حسگرهای دارای نویز، نورپردازی نامناسب یا موانع غیرمنتظره دچار خطا شوند.
