گوگل دیپ‌مایند با عرضه Gemini Robotics 2، یک مدل پیشرفته‌ی بینایی-زبان-عمل (VLA)، رسماً وارد عصر جدیدی از هوش مصنوعی تجسم‌یافته (embodied AI) شده است. این فناوری پیشگامانه به عنوان یک لایه هوش جهانی طراحی شده است که ربات‌ها را قادر می‌سازد در پلتفرم‌های سخت‌افزاری متنوع، در دنیای فیزیکی پیمایش کرده و با آن تعامل داشته باشند.

ظهور مدل‌های بینایی-زبان-عمل (VLA)

هسته‌ی اصلی این خبر، تغییر جهت به سمت مدل‌های پیچیده‌ی VLA است. برخلاف برنامه‌نویسی سنتی رباتیک که بر دستورالعمل‌های صلب و از پیش تعریف‌شده تکیه دارد، Gemini Robotics 2 تشخیص تصویر، پردازش زبان و کنترل عمل در لحظه را با هم ادغام می‌کند. این هم‌افزایی به ربات اجازه می‌دهد که نه تنها یک شیء را «ببیند» و یک فرمان صوتی را «درک کند»، بلکه حرکات فیزیکی دقیق مورد نیاز برای تعامل با آن شیء را نیز اجرا نماید.

معماری جدید DeepMind بسیار همه‌کاره است و برای مقیاس‌پذیری در انواع فرم‌های مختلف طراحی شده است. این مدل قادر است همه چیز را کنترل کند؛ از بازوهای رباتیک تخصصی روی میز که در تولید استفاده می‌شوند تا ربات‌های انسان‌نمای پیچیده و تمام‌بدنه. این قابلیت نشان‌دهنده‌ی آینده‌ای است که در آن یک هوش زیربنایی واحد می‌تواند به سخت‌افزارهای مختلف منتقل شود و به این ترتیب، موانع استقرار رباتیک پیشرفته در محیط‌های غیرقابل‌پیش‌بینی را به میزان قابل توجهی کاهش دهد.

Gemini Robotics ER 2: پیشرفت در استدلال تجسم‌یافته

در تکمیل مدل VLA، مدل Gemini Robotics ER 2 معرفی شده است که به‌طور ویژه برای «استدلال تجسم‌یافته» (embodied reasoning) مهندسی شده است. در حالی که مدل‌های VLA بر چرخه ادراک و عمل تمرکز دارند، ER 2 بر فرآیند تصمیم‌گیری شناختی سطح بالا تمرکز می‌کند؛ یعنی درک ظرافت‌های فیزیکی یک محیط و تعیین توالی بهینه‌ی اقدامات برای دستیابی به یک هدف.

Gemini Robotics ER 2 جانشین مدل Gemini Robotics ER 1.6 است که در ماه آوریل منتشر شد و جهش قابل توجهی را در قابلیت‌های استدلال نشان می‌دهد. ER 2 با ایفای نقش به عنوان یک سیستم کنترل سطح بالا، به ربات‌ها اجازه می‌دهد تا از وظایف تکراری ساده فراتر رفته و به سمت حل مسائل پیچیده در محیط‌های واقعی حرکت کنند. برای توسعه‌دهندگانی که به دنبال ادغام این قابلیت‌ها هستند، ER 2 هم‌اکنون از طریق Google AI Studio در دسترس است.

چرا این موضوع برای چشم‌انداز هوش مصنوعی اهمیت دارد

توسعه‌ی Gemini Robotics 2 نشان‌دهنده‌ی گامی محوری در مسیر دستیابی به رباتیک همه‌منظوره (General Purpose Robotics) است. سال‌هاست که این صنعت با مشکل «شکنندگی» (brittleness) دست‌وپنجه نرم می‌کند؛ یعنی تمایل ربات‌ها به شکست خوردن زمانی که با تغییرات جزئی در محیط خود مواجه می‌شوند. DeepMind با به‌کارگیری قوانین مقیاس‌پذیری و منطق مبتنی بر transformer خانواده‌ی Gemini در حرکات فیزیکی، در تلاش است تا مشکل انطباق‌پذیری را حل کند.

در صورت موفقیت، این رویکردِ «لایه هوش» می‌تواند هوش نرم‌افزاری را از مهندسی سخت‌افزار جدا کند. این امر باعث شتاب گرفتن گسترده در استقرار رباتیک می‌شود، زیرا توسعه‌دهندگان می‌توانند بر بهبود محرک‌های فیزیکی تمرکز کنند و در عین حال برای مدیریت منطق پیچیده‌ی حرکت و استدلال فضایی، به مدل‌های قدرتمند و پیش‌آموزش‌دیده‌ی گوگل تکیه کنند.

نکات کلیدی

  • سازگاری جهانی: Gemini Robotics 2 یک مدل VLA است که قادر به کنترل سخت‌افزارهای متنوع، از بازوهای کوچک روی میز گرفته تا ربات‌های انسان‌نمای پیچیده است.
  • استدلال ارتقایافته: مدل جدید Gemini Robotics ER 2 «استدلال تجسم‌یافته» پیشرفته‌ای را ارائه می‌دهد و به عنوان یک کنترل‌کننده‌ی شناختی سطح بالا برای تصمیم‌گیری‌های فیزیکی عمل می‌کند.
  • دسترسی توسعه‌دهندگان: گوگل این ابزارها را در اختیار اکوسیستم قرار می‌دهد؛ ER 2 در Google AI Studio در دسترس است و دسترسی زودهنگام به Gemini Robotics 2 نیز از طریق لیست انتظار امکان‌پذیر است.

خلاصه کلام

Gemini Robotics 2 و ماژول همراه آن یعنی ER 2، گامی ملموس به سوی یک مغز هوش مصنوعی جهانی برای ربات‌ها هستند که ادراک، زبان و کنترل را در یک سیستم واحدِ قابل آموزش ادغام می‌کنند. این رویکرد می‌تواند هزینه‌ و پیچیدگی استقرار ربات‌های پیشرفته را به طرز چشم‌گیری کاهش دهد.