تمنح نماذج RT-2 من Google DeepMind، وOpenVLA من Stanford-Toyota، وGR00T من NVIDIA، وLeRobot من Hugging Face، وPi-Zero من Physical Intelligence الروبوتات القدرة على ربط المدخلات المرئية، والأوامر اللغوية، والأفعال الحركية في نموذج واحد. وتستبدل هذه القدرة تسلسلات الخطوات المبرمجة يدويًا بسلوك "الرؤية والتنفيذ" (see-and-do)، مما يعد بتطوير أسرع ووصول أوسع لمجال الروبوتات.
لماذا تكتسب نماذج الرؤية واللغة والفعل (VLA) أهمية كبرى
طوال معظم تاريخ الروبوتات، كان المهندسون يكتبون نصوصًا برمجية صريحة تخبر الروبوت بكل حركة لمفصله. أما الفئة الجديدة من نماذج الرؤية واللغة والفعل (VLA)، فتتعامل مع الروبوت كوكيل محادثة: حيث تقوم الكاميرا ببث صورة، ويتحدث المستخدم أو يكتب طلبًا، ثم يقوم النموذج بإخراج الأوامر الحركية اللازمة لتنفيذه.
النماذج الخمسة الأبرز حاليًا
- RT-2 (Google DeepMind) – يربط التدفقات المرئية الخام باللغة البشرية، مما يسمح للروبوت بوصف ما يراه والتصرف بناءً على التعليمات المنطوقة.
- OpenVLA (Stanford + Toyota) – إصدار مفتوح المصدر يتيح لأي مطور دمج النموذج في أجهزته الخاصة.
- GR00T (NVIDIA) – صُمم للمنصات البشرية (humanoid)، حيث يقوم بتحليل المشهد وتوليد أوامر حركية منخفضة المستوى.
- LeRobot (Hugging Face) – يوفر مستودعًا للبيانات ومجموعة أدوات تسرع عملية تدريب النماذج ودمجها لمطوري الروبوتات.
- Pi-Zero (Physical Intelligence) – يشير إلى إمكانية إعادة استخدام "دماغ" واحد عبر أجسام روبوتات مختلفة، مما يبسط حزم البرمجيات لمختلف أنواع الأجهزة.
البيانات، والمحاكاة، ومشكلة الانحراف
تعتمد النماذج الخمسة جميعها على مجموعات بيانات ضخمة، يأتي معظمها من بيئات محاكاة لأن الجمع من العالم الحقيقي مكلف وينطوي على مخاطر. ويخلق هذا الاعتماد "انحرافًا من المحاكاة إلى الواقع" (sim-to-real drift): حيث قد تتعثر السلوكيات التي تم تعلمها في عوالم افتراضية مثالية عند مواجهة مستشعرات مشوشة، أو إضاءة غير متساوية، أو عقبات غير متوقعة.
