Google DeepMind נכנסה רשמית לעידן חדש של embodied AI עם השקת Gemini Robotics 2, מודל vision-language-action (VLA) פורץ דרך. טכנולוגיה פורצת דרך זו נועדה לשמש כשכבת אינטליגנציה אוניברסלית, המאפשרת לרובוטים לנווט ולתקשר עם העולם הפיזי על פני פלטפורמות חומרה מגוונות.

עלייתם של מודלי Vision-Language-Action (VLA)

במרכז ההכרזה הזו עומד המעבר לעבר מודלי VLA מתוחכמים. בניגוד לתכנות רובוטיקה מסורתי המסתמך על הוראות נוקשות ומוגדרות מראש, Gemini Robotics 2 משלב זיהוי תמונה, עיבוד שפה ובקרת פעולה בזמן אמת. סינרגיה זו מאפשרת לרובוט לא רק "לראות" אובייקט ו"להבין" פקודה מילולית, אלא גם לבצע את התנועות הפיזיות המדויקות הנדרשות כדי לתקשר עם אותו אובייקט.

הארכיטקטורה החדשה של DeepMind היא ורסטילית להפליא, ומעוצבת להתרחב על פני פורמטים (form factors) שונים. המודל מסוגל לשלוט בהכל, החל מזרועות רובוטיות ייעודיות לשולחן המשמשות בייצור ועד לרובוטים אנושיים (humanoid) מורכבים בעלי גוף מלא. יכולת זו מרמזת על עתיד שבו אינטליגנציה בסיסית אחת יכולה להיות מועברת לחומרות שונות, מה שמוריד משמעותית את חסם הפריסה של רובוטיקה מתקדמת בסביבות בלתי צפויות.

Gemini Robotics ER 2: קידום של embodied reasoning

כהשלמה למודל ה-VLA, הוצג Gemini Robotics ER 2, מודל שתוכנן במיוחד עבור "embodied reasoning" (חשיבה גופנית). בעוד שמודלי VLA מתמקדים בלולאה של תפיסה ופעולה, ER 2 מתמקד בתהליך קבלת ההחלטות הקוגניטיבי ברמה גבוהה — הבנת הניואנסים הפיזיים של סביבה וקביעת רצף הפעולות האופטימלי להשגת מטרה.

Gemini Robotics ER 2 מחליף את מודל Gemini Robotics ER 1.6 ששוחרר באפריל, ומסמן קפיצה משמעותית ביכולות החשיבה. על ידי פעולה כמערכת בקרה ברמה גבוהה, ER 2 מאפשר לרובוטים לעבור מעבר למשימות חזרתיות פשוטות לעבר פתרון בעיות מורכבות בסביבות של העולם האמיתי. עבור מפתחים המעוניינים לשלב את היכולות הללו, ER 2 כבר זמין דרך Google AI Studio.

למה זה חשוב לנוף ה-AI

הפיתוח של Gemini Robotics 2 מייצג צעד מכריע במאבק על רובוטיקה למטרות כלליות (General Purpose Robotics). במשך שנים, התעשייה נאבקה עם "שבירות" (brittleness) — הנטייה של רובוטים להיכשל כאשר הם נתקלים בשינויים קלים בסביבתם. על ידי יישום חוקי ה-scaling והלוגיקה מבוססת ה-transformer של משפחת Gemini על תנועה פיזית, DeepMind פועלת לפתרון בעיית ההסתגלות.

אם יצליח, גישת "שכבת האינטליגנציה" הזו עשויה להפריד בין האינטליגנציה של התוכנה לבין הנדסת החומרה. זה יאפשר האצה עצומה בפריסת רובוטיקה, שכן מפתחים יוכלו להתמקד בשיפור המפעילים (actuators) הפיזיים תוך הסתמכות על המודלים החזקים והמאומנים מראש של Google לניהול הלוגיקה המורכבת של תנועה וחשיבה מרחבית.

נקודות מפתח

  • תאימות אוניברסלית: Gemini Robotics 2 הוא מודל VLA המסוגל לשלוט בחומרות מגוונות, החל מזרועות שולחניות קומפקטיות ועד לרובוטים אנושיים מורכבים.
  • חשיבה משופרת: Gemini Robotics ER 2 החדש מספק "embodied reasoning" מתקדם, ומשמש כבקר קוגניטיבי ברמה גבוהה לקבלת החלטות פיזיות.
  • נגישות למפתחים: Google פותחת את הכלים הללו לאקוסיסטם, כאשר ER 2 זמין ב-Google AI Studio וגישה מוקדמת ל-Gemini Robotics 2 זמינה דרך רשימת המתנה.

שורה תחתונה

Gemini Robotics 2 ומודול ER 2 הנלווה אליו מייצגים צעד קונקרטי לעבר מוח AI אוניברסלי לרובוטים, המאחד תפיסה, שפה ובקרה למערכת אחת ניתנת לאימון. הגישה עשויה להפחית באופן דרמטי את העלות והמורכבות של פריסת רובוטים מתוחכמים.