RT-2 van Google DeepMind, OpenVLA van Stanford-Toyota, GR00T van NVIDIA, LeRobot van Hugging Face en Pi-Zero van Physical Intelligence geven robots de mogelijkheid om visuele input, taalcommando's en motorische acties in één enkel model te koppelen. Deze capaciteit vervangt handmatig gecodeerde stappenreeksen door "zie-en-doe"-gedrag, wat snellere ontwikkeling en bredere toegang tot robotica belooft.
Waarom vision-language-action belangrijk is
Gedurende het grootste deel van de geschiedenis van de robotica schreven ingenieurs expliciete scripts die een robot elke gewrichtsbeweging vertelden. De nieuwe klasse Vision-Language-Action (VLA) modellen behandelt een robot als een conversationele agent: een camera streamt een beeld, een gebruiker spreekt of typt een verzoek, en het model genereert de motorische commando's die nodig zijn om dit uit te voeren.
De vijf modellen van dit moment
- RT-2 (Google DeepMind) – Koppelt ruwe visuele streams aan menselijke taal, waardoor een robot kan beschrijven wat hij ziet en kan handelen op basis van gesproken instructies.
- OpenVLA (Stanford + Toyota) – Een open-source release waarmee elke ontwikkelaar het model in zijn eigen hardware kan integreren.
- GR00T (NVIDIA) – Gebouwd voor humanoïde platforms; het redeneert over de scène en genereert motorische commando's op laag niveau.
- LeRobot (Hugging Face) – Levert een gegevensrepository en een set tools die de modeltraining en integratie voor robotontwikkelaars versnellen.
- Pi-Zero (Physical Intelligence) – Stelt dat één enkel "brein" kan worden hergebruikt voor verschillende robotlichamen, wat softwarestacks voor uiteenlopende hardware vereenvoudigt.
Data, simulatie en het drift-probleem
Alle vijf de modellen leunen op enorme datasets, waarvan de meeste afkomstig zijn uit gesimuleerde omgevingen omdat verzameling in de echte wereld kostbaar en riskant is. Die afhankelijkheid creëert een "sim-to-real"-drift: gedragingen die zijn aangeleerd in perfecte virtuele werelden kunnen tekortschieten wanneer ze worden geconfronteerd met ruisende sensoren, ongelijkmatige verlichting of onverwachte obstakels.
