RT-2 de Google DeepMind, OpenVLA de Stanford-Toyota, GR00T de NVIDIA, LeRobot de Hugging Face et Pi-Zero de Physical Intelligence donnent aux robots la capacité de lier les entrées visuelles, les commandes linguistiques et les actions motrices au sein d'un modèle unique. Cette capacité remplace les séquences d'étapes codées à la main par un comportement de type « voir et faire », promettant un développement plus rapide et un accès élargi à la robotique.
Pourquoi la vision-langage-action est importante
Pendant la majeure partie de l'histoire de la robotique, les ingénieurs écrivaient des scripts explicites qui indiquaient au robot chaque mouvement d'articulation. La nouvelle classe de modèles Vision-Langage-Action (VLA) traite le robot comme un agent conversationnel : une caméra diffuse une image, un utilisateur formule une requête par la voix ou par écrit, et le modèle génère les commandes motrices nécessaires pour l'exécuter.
Les cinq modèles phares
- RT-2 (Google DeepMind) – Relie les flux visuels bruts au langage humain, permettant à un robot de décrire ce qu'il voit et d'agir selon des instructions vocales.
- OpenVLA (Stanford + Toyota) – Une version open-source qui permet à n'importe quel développeur d'intégrer le modèle à son propre matériel.
- GR00T (NVIDIA) – Conçu pour les plateformes humanoïdes, il raisonne sur la scène et génère des commandes motrices de bas niveau.
- LeRobot (Hugging Face) – Fournit un référentiel de données et un ensemble d'outils qui accélèrent l'entraînement et l'intégration des modèles pour les développeurs de robots.
- Pi-Zero (Physical Intelligence) – Indique qu'un seul « cerveau » peut être réutilisé sur différents corps de robots, simplifiant ainsi les piles logicielles pour des matériels variés.
Données, simulation et le problème de la dérive
Ces cinq modèles s'appuient sur des ensembles de données massifs, dont la plupart proviennent d'environnements simulés car la collecte en conditions réelles est coûteuse et risquée. Cette dépendance crée une dérive « sim-to-real » : les comportements appris dans des mondes virtuels parfaits peuvent échouer face à des capteurs bruités, un éclairage inégal ou des obstacles imprévus.
