Google DeepMinds RT-2, Stanfords und Toyotas OpenVLA, NVIDIAs GR00T, Hugging Faces LeRobot und Physical Intelligences Pi-Zero verleihen Robotern die Fähigkeit, visuellen Input, Sprachbefehle und motorische Aktionen in einem einzigen Modell zu verknüpfen. Diese Fähigkeit ersetzt handcodierte Schrittsequenzen durch ein „Sehen-und-Handeln“-Verhalten, was eine schnellere Entwicklung und einen breiteren Zugang zur Robotik verspricht.

Warum Vision-Language-Action wichtig ist

In der Großteil der Robotikgeschichte schrieben Ingenieure explizite Skripte, die einem Roboter jede einzelne Gelenkbewegung vorgaben. Die neue Klasse von Vision-Language-Action (VLA)-Modellen behandelt einen Roboter wie einen Gesprächsassistenten: Eine Kamera streamt ein Bild, ein Benutzer spricht oder tippt eine Anfrage ein, und das Modell gibt die notwendigen Motorbefehle aus, um diese zu erfüllen.

Die fünf aktuellen Modelle

  • RT-2 (Google DeepMind) – Verbindet rohe visuelle Streams mit menschlicher Sprache und ermöglicht es einem Roboter, zu beschreiben, was er sieht, und auf gesprochene Anweisungen zu reagieren.
  • OpenVLA (Stanford + Toyota) – Eine Open-Source-Veröffentlichung, die es jedem Entwickler ermöglicht, das Modell in die eigene Hardware einzubinden.
  • GR00T (NVIDIA) – Entwickelt für humanoide Plattformen, analysiert es die Szene und generiert motorische Befehle auf niedriger Ebene.
  • LeRobot (Hugging Face) – Stellt ein Daten-Repository und ein Toolset bereit, das das Modelltraining und die Integration für Roboterentwickler beschleunigt.
  • Pi-Zero (Physical Intelligence) – Besagt, dass ein einzelnes „Gehirn“ für verschiedene Roboterkörper wiederverwendet werden kann, was die Software-Stacks für unterschiedliche Hardware vereinfacht.

Daten, Simulation und das Drift-Problem

Alle fünf Modelle stützen sich auf massive Datensätze, von denen die meisten aus simulierten Umgebungen stammen, da die Datenerfassung in der realen Welt kostspielig und riskant ist. Diese Abhängigkeit führt zu einem „Sim-to-Real“-Drift: Verhaltensweisen, die in perfekten virtuellen Welten erlernt wurden, können scheitern, wenn sie mit verrauschten Sensoren, ungleichmäßiger Beleuchtung oder unerwarteten Hindernissen konfrontiert werden.