Chiński model świata Orca dorównuje wyspecjalizowanej robotyce bez etykiet działań
Przełomowe odkrycie chińskich naukowców rzuca wyzwanie fundamentalnej definicji inteligencji AI, udowadniając, że ujednolicony model świata może opanować robotykę bez bezpośredniego nadzoru. Model Orca pokazuje, że poprzez samą obserwację zmian zachodzących w świecie za pomocą wideo, sztuczna inteligencja może rozwinąć głębokie wewnętrzne zrozumienie, zdolne do sterowania złożonymi działaniami fizycznymi.
Silnik podwójnego uczenia: tryby nieświadomy i świadomy
Orca odchodzi od tradycyjnych, wyspecjalizowanych modeli, wykorzystując dwutorowe podejście do uczenia w celu budowy swojego wewnętrznego „stanu świata”. Pierwsza metoda, „uczenie nieświadome”, polega na przetwarzaniu 125 000 godzin nieoznakowanych nagrań wideo. W tej fazie model przewiduje przyszłe klatki w przestrzeni abstrakcyjnej, co pozwala mu zrozumieć wzorce ruchu, przesłanianie obiektów oraz dynamikę sceny bez potrzeby stosowania choćby jednego opisu.
Druga metoda, „uczenie świadome”, wprowadza instrukcje werbalne i opisy. Poprzez segmentację wideo i etykietowanie wynikających ze zmian stanu, Orca uczy się związku przyczynowo-skutkowego między konkretnym działaniem a jego fizycznym rezultatem. To połączenie pozwala modelowi zasypać przepaść między surową percepcją wizualną a wysokopoziomowym rozumowaniem językowym.
Zamrożony rdzeń z wymiennymi modułami inteligencji
Architektura Orca została zaprojektowana z myślą o ekstremalnej wszechstronności. Wykorzystuje ona wstępnie wytrenowany model językowo-obrazowy Qwen3.5 jako „zamrożony rdzeń”. Zamiast trenować cały system od nowa dla każdego zadania, badacze do tej stabilnej podstawy dołączają wyspecjalizowane, lekkie „głowice” (heads):
- Wyjście tekstowe: Wykorzystuje istniejącą głowicę językową Qwen3.5.
- Generowanie obrazów: Wykorzystuje małe adaptery połączone ze Stable Diffusion 3.5, aby tłumaczyć wewnętrzny stan świata na przewidywania wizualne.
- Sterowanie robotem: Wykorzystuje zbudowany na zamówienie moduł „Action Expert”, wyspecjalizowany w przekształcaniu stanów świata w ruchy fizyczne.
Ta modularność zapewnia, że centralne rozumienie świata pozostaje spójne, niezależnie od tego, czy model odpowiada na pytanie, generuje wideo, czy steruje mechanicznym ramieniem.
Przewyższanie wyspecjalizowanych modeli i gigantów
Metryki wydajności dla Orca-4B są znaczące. W tekstowych benchmarkach wideo Orca-4B osiągnęła średnio 51,8%, przewyższając znacznie większe modele, takie jak Emu3 (34B), oraz wyspecjalizowane modele VLM, takie jak DeepSeek-VL2-3B. W zadaniach przewidywania obrazu w benchmarku PRICE-V0.1, Orca-4B uzyskała wynik 59,8%, wyprzedzając zaawansowane generatory, takie jak FLUX.2 small.
Co najbardziej imponujące, Orca dorównuje $\pi$0.5 — systemowi zbudowanemu wyłącznie na danych dotyczących działań robotycznych — w pięciu zadaniach manipulacyjnych, takich jak układanie misek czy nabieranie cukru. Co kluczowe, Orca osiągnęła to bez widzenia jakiejkolwiek etykiety działania podczas swojej masowej fazy wstępnego trenowania. Wykazała nawet lepszą zdolność do regeneracji po błędach, ponawiając nieudane próby chwytania, podczas gdy wyspecjalizowane modele często wpadały w powtarzalne pętle.
Dlaczego ma to znaczenie dla przyszłości AI
Orca rozwiązuje jeden z najpoważniejszych problemów wąskich gardeł we współczesnej robotyce: chroniczny brak etykietowanych danych dotyczących działań. Udowadniając, że AI może uczyć się „fizyki świata” poprzez pasywną obserwację, badania te torują drogę do robotów ogólnego przeznaczenia, które można wdrażać w nowych środowiskach bez konieczności dostarczania milionów godzin ręcznie etykietowanych danych z teleoperacji.
Kluczowe wnioski
- Podstawa nienadzorowana: Orca uczy się dynamiki świata poprzez „uczenie nieświadome” na nieoznakowanych filmach, co zmniejsza zależność od kosztownych zbiorów danych anotowanych przez ludzi.
- Modularna architektura: Wykorzystanie zamrożonego rdzenia Qwen3.5 z wymiennymi adapterami pozwala jednemu modelowi jednocześnie doskonale radzić sobie z tekstem, obrazem i sterowaniem robotem.
- Zrównanie z robotyką: Orca-4B dorównuje wydajnością wyspecjalizowanym systemom robotycznym w zadaniach manipulacyjnych, mimo braku wcześniejszego kontaktu z etykietami działań podczas wstępnego trenowania.