RT-2 של Google DeepMind, OpenVLA של Stanford-Toyota, GR00T של NVIDIA, LeRobot של Hugging Face ו-Pi-Zero של Physical Intelligence מעניקים לרובוטים את היכולת לקשר בין קלט ויזואלי, פקודות שפה ופעולות מוטוריות במודל אחד. יכולת זו מחליפה רצפי שלבים שתוכנתו ידנית בהתנהגות של "ראה-ועשה" (see-and-do), ומבטיחה פיתוח מהיר יותר וגישה רחבה יותר לתחום הרובוטיקה.

למה vision-language-action חשוב

במשך רוב ההיסטוריה של הרובוטיקה, מהנדסים כתבו סקריפטים מפורשים שהורו לרובוט על כל תנועת מפרק. המחלקה החדשה של מודלי Vision-Language-Action (VLA) מתייחסת לרובוט כסוכן שיחתי: מצלמה משדרת תמונה, משתמש מדבר או מקליד בקשה, והמודל מוציא את הפקודות המוטוריות הדרושות למימוש שלה.

חמשת המודלים המרכזיים כרגע

  • RT-2 (Google DeepMind) – מחבר בין זרמי ויזואליים גולמיים לשפת בני אדם, מה שמאפשר לרובוט לתאר את מה שהוא רואה ולפעול על פי הוראות קוליות.
  • OpenVLA (Stanford + Toyota) – גרסה בקוד פתוח המאפשרת לכל מפתח לחבר את המודל לחומרה שלו.
  • GR00T (NVIDIA) – נבנה עבור פלטפורמות אנושיות (humanoid), הוא מבצע הסקה לגבי הסצנה ומייצר פקודות מוטוריות ברמה נמוכה.
  • LeRobot (Hugging Face) – מספק מאגר נתונים וערכת כלים המאיצים את אימון המודל ואת האינטגרציה עבור מפתחי רובוטים.
  • Pi-Zero (Physical Intelligence) – טוען שניתן להשתמש מחדש ב"מוח" יחיד עבור גופי רובוטים שונים, מה שמפשט את מערכי התוכנה (software stacks) עבור חומרה מגוונת.

נתונים, סימולציה ובעיית הסטייה (drift)

כל חמשת המודלים נשענים על מאגרי נתונים עצומים, שרובם מגיעים מסביבות סימולציה מכיוון שאיסוף בעולם האמיתי הוא יקר ומסוכן. הסתמכות זו יוצרת סטייה של "sim-to-real": התנהגויות שנלמדו בעולמות וירטואליים מושלמים עלולות להיכשל מול חיישנים רועשים, תאורה לא אחידה או מכשולים בלתי צפויים.