RT-2 od Google DeepMind, OpenVLA od Stanford-Toyota, GR00T od NVIDIA, LeRobot od Hugging Face oraz Pi-Zero od Physical Intelligence dają robotom zdolność łączenia danych wizualnych, poleceń językowych i działań motorycznych w ramach jednego modelu. Ta zdolność zastępuje ręcznie kodowane sekwencje kroków zachowaniem typu „widzisz i robisz” (see-and-do), obiecując szybszy rozwój i szerszy dostęp do robotyki.

Dlaczego modele vision-language-action są ważne

Przez większość historii robotyki inżynierowie pisali jawne skrypty, które instruowały robota o każdym ruchu stawu. Nowa klasa modeli Vision-Language-Action (VLA) traktuje robota jak agenta konwersacyjnego: kamera przesyła obraz, użytkownik wypowiada lub wpisuje prośbę, a model generuje polecenia motoryczne niezbędne do jej realizacji.

Pięć kluczowych modeli

  • RT-2 (Google DeepMind) – Łączy surowe strumienie wizualne z językiem ludzkim, pozwalając robotowi opisywać to, co widzi, i działać na podstawie poleceń głosowych.
  • OpenVLA (Stanford + Toyota) – Rozwiązanie open-source, które pozwala każdemu programiście podłączyć model do własnego sprzętu.
  • GR00T (NVIDIA) – Zbudowany z myślą o platformach humanoidalnych, analizuje otoczenie i generuje niskopoziomowe polecenia motoryczne.
  • LeRobot (Hugging Face) – Dostarcza repozytorium danych i zestaw narzędzi, które przyspieszają trenowanie i integrację modeli dla twórców robotów.
  • Pi-Zero (Physical Intelligence) – Zakłada, że pojedynczy „mózg” może być ponownie wykorzystywany w różnych ciałach robotów, co upraszcza stosy oprogramowania dla różnorodnego sprzętu.

Dane, symulacja i problem dryfu

Wszystkie pięć modeli opiera się na ogromnych zbiorach danych, z których większość pochodzi ze środowisk symulowanych, ponieważ zbieranie danych w świecie rzeczywistym jest kosztowne i ryzykowne. To poleganie na symulacjach tworzy zjawisko „dryfu sim-to-real”: zachowania wyuczone w idealnych wirtualnych światach mogą zawieść w starciu z zaszumionymi czujnikami, nierównym oświetleniem lub nieoczekiwanymi przeszkodami.