گوگل دیپمایند با عرضه Gemini Robotics 2، یک مدل پیشرفتهی بینایی-زبان-عمل (VLA)، رسماً وارد عصر جدیدی از هوش مصنوعی تجسمیافته (embodied AI) شده است. این فناوری پیشگامانه به عنوان یک لایه هوش جهانی طراحی شده است که رباتها را قادر میسازد در پلتفرمهای سختافزاری متنوع، در دنیای فیزیکی پیمایش کرده و با آن تعامل داشته باشند.
ظهور مدلهای بینایی-زبان-عمل (VLA)
هستهی اصلی این خبر، تغییر جهت به سمت مدلهای پیچیدهی VLA است. برخلاف برنامهنویسی سنتی رباتیک که بر دستورالعملهای صلب و از پیش تعریفشده تکیه دارد، Gemini Robotics 2 تشخیص تصویر، پردازش زبان و کنترل عمل در لحظه را با هم ادغام میکند. این همافزایی به ربات اجازه میدهد که نه تنها یک شیء را «ببیند» و یک فرمان صوتی را «درک کند»، بلکه حرکات فیزیکی دقیق مورد نیاز برای تعامل با آن شیء را نیز اجرا نماید.
معماری جدید DeepMind بسیار همهکاره است و برای مقیاسپذیری در انواع فرمهای مختلف طراحی شده است. این مدل قادر است همه چیز را کنترل کند؛ از بازوهای رباتیک تخصصی روی میز که در تولید استفاده میشوند تا رباتهای انساننمای پیچیده و تمامبدنه. این قابلیت نشاندهندهی آیندهای است که در آن یک هوش زیربنایی واحد میتواند به سختافزارهای مختلف منتقل شود و به این ترتیب، موانع استقرار رباتیک پیشرفته در محیطهای غیرقابلپیشبینی را به میزان قابل توجهی کاهش دهد.
Gemini Robotics ER 2: پیشرفت در استدلال تجسمیافته
در تکمیل مدل VLA، مدل Gemini Robotics ER 2 معرفی شده است که بهطور ویژه برای «استدلال تجسمیافته» (embodied reasoning) مهندسی شده است. در حالی که مدلهای VLA بر چرخه ادراک و عمل تمرکز دارند، ER 2 بر فرآیند تصمیمگیری شناختی سطح بالا تمرکز میکند؛ یعنی درک ظرافتهای فیزیکی یک محیط و تعیین توالی بهینهی اقدامات برای دستیابی به یک هدف.
Gemini Robotics ER 2 جانشین مدل Gemini Robotics ER 1.6 است که در ماه آوریل منتشر شد و جهش قابل توجهی را در قابلیتهای استدلال نشان میدهد. ER 2 با ایفای نقش به عنوان یک سیستم کنترل سطح بالا، به رباتها اجازه میدهد تا از وظایف تکراری ساده فراتر رفته و به سمت حل مسائل پیچیده در محیطهای واقعی حرکت کنند. برای توسعهدهندگانی که به دنبال ادغام این قابلیتها هستند، ER 2 هماکنون از طریق Google AI Studio در دسترس است.
چرا این موضوع برای چشمانداز هوش مصنوعی اهمیت دارد
توسعهی Gemini Robotics 2 نشاندهندهی گامی محوری در مسیر دستیابی به رباتیک همهمنظوره (General Purpose Robotics) است. سالهاست که این صنعت با مشکل «شکنندگی» (brittleness) دستوپنجه نرم میکند؛ یعنی تمایل رباتها به شکست خوردن زمانی که با تغییرات جزئی در محیط خود مواجه میشوند. DeepMind با بهکارگیری قوانین مقیاسپذیری و منطق مبتنی بر transformer خانوادهی Gemini در حرکات فیزیکی، در تلاش است تا مشکل انطباقپذیری را حل کند.
در صورت موفقیت، این رویکردِ «لایه هوش» میتواند هوش نرمافزاری را از مهندسی سختافزار جدا کند. این امر باعث شتاب گرفتن گسترده در استقرار رباتیک میشود، زیرا توسعهدهندگان میتوانند بر بهبود محرکهای فیزیکی تمرکز کنند و در عین حال برای مدیریت منطق پیچیدهی حرکت و استدلال فضایی، به مدلهای قدرتمند و پیشآموزشدیدهی گوگل تکیه کنند.
نکات کلیدی
- سازگاری جهانی: Gemini Robotics 2 یک مدل VLA است که قادر به کنترل سختافزارهای متنوع، از بازوهای کوچک روی میز گرفته تا رباتهای انساننمای پیچیده است.
- استدلال ارتقایافته: مدل جدید Gemini Robotics ER 2 «استدلال تجسمیافته» پیشرفتهای را ارائه میدهد و به عنوان یک کنترلکنندهی شناختی سطح بالا برای تصمیمگیریهای فیزیکی عمل میکند.
- دسترسی توسعهدهندگان: گوگل این ابزارها را در اختیار اکوسیستم قرار میدهد؛ ER 2 در Google AI Studio در دسترس است و دسترسی زودهنگام به Gemini Robotics 2 نیز از طریق لیست انتظار امکانپذیر است.
خلاصه کلام
Gemini Robotics 2 و ماژول همراه آن یعنی ER 2، گامی ملموس به سوی یک مغز هوش مصنوعی جهانی برای رباتها هستند که ادراک، زبان و کنترل را در یک سیستم واحدِ قابل آموزش ادغام میکنند. این رویکرد میتواند هزینه و پیچیدگی استقرار رباتهای پیشرفته را به طرز چشمگیری کاهش دهد.
