دخلت Google DeepMind رسميًا عصرًا جديدًا من الذكاء الاصطناعي المجسد (embodied AI) مع إطلاق Gemini Robotics 2، وهو نموذج متطور للرؤية واللغة والعمل (VLA). صُممت هذه التقنية الرائدة لتكون بمثابة طبقة ذكاء عالمية، مما يمكن الروبوتات من التنقل والتفاعل مع العالم المادي عبر منصات أجهزة متنوعة.

صعود نماذج الرؤية واللغة والعمل (VLA)

يكمن في جوهر هذا الإعلان التحول نحو نماذج VLA المتطورة. فخلافًا لبرمجة الروبوتات التقليدية التي تعتمد على تعليمات جامدة ومحددة مسبقًا، يدمج Gemini Robotics 2 بين التعرف على الصور، ومعالجة اللغة، والتحكم في العمل في الوقت الفعلي. يتيح هذا التآزر للروبوت ليس فقط "رؤية" جسم ما و"فهم" أمر لفظي، بل وأيضًا تنفيذ الحركات الفيزيائية الدقيقة المطلوبة للتفاعل مع ذلك الجسم.

تتميز بنية DeepMind الجديدة بتعدد استخداماتها بشكل ملحوظ، حيث صُممت لتتوسع عبر مختلف أشكال الهياكل. النموذج قادر على التحكم في كل شيء، بدءًا من الأذرع الروبوتية المتخصصة على الطاولات المستخدمة في التصنيع، وصولاً إلى الروبوتات البشرية المعقدة كاملة الجسم. تشير هذه القدرة إلى مستقبل يمكن فيه نقل ذكاء أساسي واحد إلى أجهزة مختلفة، مما يقلل بشكل كبير من حواجز نشر الروبوتات المتقدمة في البيئات غير المتوقعة.

Gemini Robotics ER 2: تطوير الاستدلال المجسد

واستكمالًا لنموذج VLA، تم تقديم Gemini Robotics ER 2، وهو نموذج صُمم خصيصًا لـ "الاستدلال المجسد" (embodied reasoning). وبينما تركز نماذج VLA على حلقة الإدراك والعمل، يركز ER 2 على عملية اتخاذ القرار المعرفي رفيعة المستوى — أي فهم الفروق الفيزيائية الدقيقة للبيئة وتحديد التسلسل الأمثل من الإجراءات لتحقيق هدف ما.

يحل Gemini Robotics ER 2 محل نموذج Gemini Robotics ER 1.6 الذي تم إصداره في أبريل، مما يمثل قفزة نوعية في قدرات الاستدلال. ومن خلال العمل كنظام تحكم رفيع المستوى، يتيح ER 2 للروبوتات تجاوز المهام التكرارية البسيطة والتوجه نحو حل المشكلات المعقدة في بيئات العالم الحقيقي. وللمطورين الذين يتطلعون إلى دمج هذه القدرات، فإن ER 2 متاح بالفعل عبر Google AI Studio.

لماذا يهم هذا مشهد الذكاء الاصطناعي

يمثل تطوير Gemini Robotics 2 خطوة محورية في السعي نحو الروبوتات متعددة الأغراض (General Purpose Robotics). لسنوات، عانى القطاع من مشكلة "الهشاشة" (brittleness) — وهي ميل الروبوتات للفشل عند مواجهة اختلافات طفيفة في بيئتها. ومن خلال تطبيق قوانين التوسع ومنطق المحولات (transformer-based logic) الخاص بعائلة Gemini على الحركة الفيزيائية، تعمل DeepMind على حل مشكلة القدرة على التكيف.

إذا نجح هذا النهج القائم على "طبقة الذكاء"، فقد يؤدي إلى فصل ذكاء البرمجيات عن هندسة الأجهزة. وهذا من شأنه أن يسمح بتسريع هائل في نشر الروبوتات، حيث يمكن للمطورين التركيز على تحسين المشغلات الميكانيكية (actuators) مع الاعتماد على نماذج Google القوية والمدربة مسبقًا للتعامل مع المنطق المعقد للحركة والاستدلال المكاني.

النقاط الرئيسية

  • التوافق العالمي: Gemini Robotics 2 هو نموذج VLA قادر على التحكم في أجهزة متنوعة، بدءًا من الأذرع المدمجة على الطاولات وصولاً إلى الروبوتات البشرية المعقدة.
  • استدلال معزز: يوفر Gemini Robotics ER 2 الجديد "استدلالًا مجسدًا" متطورًا، حيث يعمل كمتحكم معرفي رفيع المستوى لاتخاذ القرارات الفيزيائية.
  • سهولة الوصول للمطورين: تفتح Google هذه الأدوات للنظام البيئي، حيث يتوفر ER 2 في Google AI Studio، كما يتوفر الوصول المبكر إلى Gemini Robotics 2 عبر قائمة انتظار.

الخلاصة

يمثل Gemini Robotics 2 ووحدة ER 2 المرافقة له خطوة ملموسة نحو دماغ ذكاء اصطناعي عالمي للروبوتات، حيث يدمج الإدراك واللغة والتحكم في نظام واحد قابل للتدريب. يمكن لهذا النهج أن يقلل بشكل كبير من تكلفة وتعقيد نشر الروبوتات المتطورة.