Google DeepMind est officiellement entré dans une nouvelle ère de l'IA incarnée avec le lancement de Gemini Robotics 2, un modèle de pointe vision-langage-action (VLA). Cette technologie révolutionnaire est conçue pour servir de couche d'intelligence universelle, permettant aux robots de naviguer et d'interagir avec le monde physique sur diverses plateformes matérielles.

L'essor des modèles Vision-Langage-Action (VLA)

Au cœur de cette annonce se trouve le passage vers des modèles VLA sophistiqués. Contrairement à la programmation robotique traditionnelle qui repose sur des instructions rigides et prédéfinies, Gemini Robotics 2 intègre la reconnaissance d'images, le traitement du langage et le contrôle des actions en temps réel. Cette synergie permet à un robot non seulement de « voir » un objet et de « comprendre » une commande verbale, mais aussi d'exécuter les mouvements physiques précis nécessaires pour interagir avec cet objet.

La nouvelle architecture de DeepMind est remarquablement polyvalente, conçue pour s'adapter à différents formats. Le modèle est capable de contrôler aussi bien des bras robotiques de table spécialisés utilisés dans l'industrie que des robots humanoïdes complexes à corps complet. Cette capacité laisse entrevoir un avenir où une intelligence sous-jacente unique pourrait être transférée sur différents matériels, abaissant ainsi considérablement la barrière au déploiement de la robotique avancée dans des environnements imprévisibles.

Gemini Robotics ER 2 : Faire progresser le raisonnement incarné

En complément du modèle VLA, l'introduction de Gemini Robotics ER 2 propose un modèle spécifiquement conçu pour le « raisonnement incarné » (embodied reasoning). Alors que les modèles VLA se concentrent sur la boucle perception-action, ER 2 se focalise sur le processus de prise de décision cognitive de haut niveau : comprendre les nuances physiques d'un environnement et déterminer la séquence d'actions optimale pour atteindre un objectif.

Gemini Robotics ER 2 succède au modèle Gemini Robotics ER 1.6 publié en avril, marquant un bond significatif dans les capacités de raisonnement. En agissant comme un système de contrôle de haut niveau, ER 2 permet aux robots de dépasser les simples tâches répétitives pour s'orienter vers la résolution de problèmes complexes dans des contextes réels. Pour les développeurs souhaitant intégrer ces capacités, ER 2 est déjà disponible via Google AI Studio.

Pourquoi cela est important pour le paysage de l'IA

Le développement de Gemini Robotics 2 représente une étape charnière dans la quête de la robotique à usage général (General Purpose Robotics). Pendant des années, l'industrie a lutté contre la « fragilité » (brittleness) — la tendance des robots à échouer face à de légères variations de leur environnement. En appliquant les lois de mise à l'échelle (scaling laws) et la logique basée sur les transformers de la famille Gemini au mouvement physique, DeepMind s'efforce de résoudre le problème de l'adaptabilité.

En cas de succès, cette approche de « couche d'intelligence » pourrait découpler l'intelligence logicielle de l'ingénierie matérielle. Cela permettrait une accélération massive du déploiement de la robotique, car les développeurs pourraient se concentrer sur l'amélioration des actionneurs physiques tout en s'appuyant sur les modèles robustes et pré-entraînés de Google pour gérer la logique complexe du mouvement et du raisonnement spatial.

Points clés à retenir

  • Compatibilité universelle : Gemini Robotics 2 est un modèle VLA capable de contrôler divers matériels, allant des bras de table compacts aux robots humanoïdes complexes.
  • Raisonnement amélioré : Le nouveau Gemini Robotics ER 2 offre un « raisonnement incarné » avancé, agissant comme un contrôleur cognitif de haut niveau pour la prise de décision physique.
  • Accessibilité pour les développeurs : Google ouvre ces outils à l'écosystème, avec ER 2 disponible dans Google AI Studio et un accès anticipé à Gemini Robotics 2 via une liste d'attente.

L'essentiel

Gemini Robotics 2 et le module ER 2 l'accompagnant représentent une étape concrète vers un cerveau d'IA universel pour les robots, fusionnant perception, langage et contrôle en un seul système entraînable. Cette approche pourrait réduire considérablement le coût et la complexité du déploiement de robots sophistiqués.