Xiaomi-Robotics-1 доказывает: объем данных важнее размера модели в робототехнике
Xiaomi представила Xiaomi-Robotics-1 — прорывную базовую модель, которая меняет парадигму обучения роботов: вместо наращивания вычислительной мощности акцент смещается на масштабное масштабирование данных. Благодаря уникальному методу сбора данных модель демонстрирует беспрецедентную адаптивность в незнакомых средах и при выполнении сложных задач по манипуляции объектами.
Преодоление «узкого места» данных с помощью ручных захватов
Основной проблемой в робототехнике всегда было «узкое место данных» — сложность сбора огромного количества высококачественных данных о взаимодействии без использования дорогостоящих стационарных манипуляторов. Xiaomi обошла это препятствие, используя портативные ручные захваты, оснащенные камерами.
Вместо программирования роботов операторы-люди использовали эти ручные устройства для записи задач по манипуляции в более чем 1700 различных средах, включая кухни, офисы и заводы. Такой подход позволил получить ошеломляющие 100 000 часов записей движений. Чтобы решить проблему разметки, Xiaomi применила модель ИИ для автоматической генерации текстовых описаний для каждого сегмента движения, завершив разметку всего набора данных всего за две недели.
Закон масштабирования: данные важнее вычислений
Ключевой технический вывод исследования Xiaomi-Robotics-1 заключается в том, что увеличение объема обучающих данных дает значительно больший прирост производительности, чем простое увеличение размера модели или вычислительной мощности. Хотя более крупные модели действительно снижают ошибки прогнозирования, показатель успеха робота в незнакомых средах взлетел с 25% до 75% по мере роста объема обучающих данных.
Это отражает тенденции, наблюдаемые в компьютерном зрении, где добавление данных приносит больше пользы, чем увеличение количества параметров. Для Xiaomi это означает, что путь к созданию универсального ИИ для роботов лежит через разнообразие и масштаб наборов данных, а не просто через построение более крупных нейронных сетей.
Непревзойденная адаптивность и результаты бенчмарков
Xiaomi-Robotics-1 разработана для выполнения голосовых или письменных команд и адаптации к новым задачам с минимальной донастройкой. В ходе тестирования модели поручались сложные маневры, такие как загрузка белья, подача бумаги в принтер и упаковка чемоданов.
Результаты были однозначными:
- Быстрая адаптация: При менее чем 10 часах специализированного обучения модель достигла 75% успеха, значительно опередив конкурента Physical Intelligence, чей показатель составил всего 40%.
- Доминирование в бенчмарках: Модель с большим отрывом лидирует в таблице лидеров RoboCasa365, особенно в новых комбинированных задачах.
- Результаты в RoboDojo: Xiaomi-Robotics-1 набрала примерно на 58% больше баллов, чем ближайший преследователь в бенчмарке RoboDojo.
Модель также продемонстрировала особую эффективность при работе с мягкими, деформируемыми материалами, такими как бумага, что исторически является сложной областью для жестких робототехнических систем.
Новое направление для индустрии робототехники
Подход Xiaomi находится на перепутье с другими гигантами индустрии. В то время как Nvidia пытается превратить проблему данных в робототехнике в проблему вычислений с помощью генерации синтетических данных, а модель Orca от BAAI пытается обучаться на неразмеченном видео, Xiaomi делает ставку на автоматизированные крупномасштабные размеченные данные о движениях.
Пока Xiaomi готовится выпустить модель и код на GitHub и Hugging Face, индустрия внимательно следит за развитием событий. Это достижение говорит о том, что следующий рубеж в робототехнике будет покорен не теми, у кого самые мощные чипы, а теми, у кого самые разнообразные и качественно размеченные наборы данных о движениях.
Ключевые выводы
- Масштабирование, ориентированное на данные: Увеличение объема обучающих данных оказалось более эффективным для повышения показателей успеха роботов, чем увеличение размера модели или вычислительной мощности.
- Инновационный сбор: Ручные захваты позволили Xiaomi собрать 100 000 часов данных о движениях в 1700 средах без необходимости использования специализированных роботов.
- Высокая обобщающая способность: Модель может достигать 75% успеха в новых задачах менее чем за 10 часов дополнительного обучения.
