Китайська модель світу Orca зрівнюється зі спеціалізованою робототехнікою без міток дій
Прорив китайських дослідників кидає виклик фундаментальному визначенню штучного інтелекту, доводячи, що уніфікована модель світу може опанувати робототехніку без прямого нагляду. Модель Orca демонструє, що завдяки простому спостереженню за тим, як змінюється світ через відео, ШІ може розвинути глибоке внутрішнє розуміння, здатне керувати складними фізичними діями.
Двигун подвійного навчання: несвідомий та свідомий режими
Orca відходить від традиційних спеціалізованих моделей, використовуючи двосторонній підхід до навчання для побудови свого внутрішнього «стану світу». Перший метод, «несвідоме навчання», передбачає обробку 125 000 годин немаркованого відео. На цьому етапі модель передбачає майбутні кадри в абстрактному просторі, що дозволяє їй осягнути патерни руху, перекриття об'єктів та динаміку сцен без жодного текстового опису.
Другий метод, «свідоме навчання», впроваджує вербальні інструкції та описи. Шляхом сегментації відео та маркування відповідних змін стану, Orca вивчає причинно-наслідковий зв'язок між конкретною дією та її фізичним результатом. Таке поєднання дозволяє моделі подолати розрив між чистим зоровим сприйняттям і високорівневим лінгвістичним мисленням.
Заморожене ядро зі змінними модулями інтелекту
Архітектура Orca розроблена для надзвичайної універсальності. Вона використовує попередньо навчену мовно-зорову модель Qwen3.5 як «заморожене ядро». Замість перенавчання всієї системи для кожного завдання, дослідники приєднують до цього стабільного фундаменту спеціалізовані легкі «голови»:
- Текстовий вивід: використовує існуючу мовну «голову» Qwen3.5.
- Генерація зображень: використовує невеликі адаптери, підключені до Stable Diffusion 3.5, для перетворення внутрішнього стану світу у візуальні прогнози.
- Керування роботом: використовує спеціально розроблений модуль «Action Expert», навчений перетворювати стани світу на фізичні рухи.
Така модульність гарантує, що центральне розуміння світу залишається послідовним, незалежно від того, чи відповідає модель на запитання, генерує відео чи керує механічним маніпулятором.
Перевершення спеціалізованих моделей та гігантів
Показники продуктивності Orca-4B є значними. У текстових відеобенчмарках Orca-4B досягла середнього результату 51,8%, перевершивши набагато більші моделі, такі як Emu3 (34B), та спеціалізовані VLM, як-от DeepSeek-VL2-3B. У завданнях прогнозування зображень за допомогою бенчмарка PRICE-V0.1 Orca-4B набрала 59,8%, випередивши висококласні генератори, такі як FLUX.2 small.
Найбільше вражає те, що Orca демонструє паритет із $\pi$0.5 — системою, побудованою виключно на даних про дії роботів — у п'яти завданнях з маніпуляції, таких як складання мисок і зачерпування цукру. Що важливо, Orca досягла цього, жодного разу не бачачи міток дій під час свого масивного етапу попереднього навчання. Вона навіть продемонструвала краще відновлення після помилок, повторно намагаючись здійснити невдалі захоплення, тоді як спеціалізовані моделі часто зациклювалися.
Чому це важливо для майбутнього ШІ
Orca вирішує одну з найголовніших проблем сучасної робототехніки: хронічну нестачу маркованих даних про дії. Доводячи, що ШІ може вивчати «фізику світу» шляхом пасивного спостереження, це дослідження прокладає шлях до універсальних роботів, які можна розгортати в нових середовищах без необхідності у мільйонах годин ручного маркування даних телеоперацій.
Основні висновки
- Безсупервізійний фундамент: Orca вивчає динаміку світу через «несвідоме навчання» на немаркованому відео, зменшуючи залежність від дорогих наборів даних, розмічених людьми.
- Модульна архітектура: Використання замороженого ядра Qwen3.5 зі змінними адаптерами дозволяє одній моделі одночасно досягати успіхів у роботі з текстом, зображеннями та керуванні роботами.
- Роботичний паритет: Orca-4B зрівнюється з продуктивністю спеціалізованих робототехнічних систем у завданнях маніпуляції, попри відсутність попереднього досвіду роботи з мітками дій під час попереднього навчання.