Передовой рубеж физического ИИ сталкивается с серьезным препятствием: нехваткой высокоточных обучающих данных из реального мира. Большие языковые модели развивались за счет сбора текстов из интернета; робототехнике же требуется гораздо более дорогостоящий подход.

Проблема дефицита данных в робототехнике

Чтобы человекоподобные и складские роботы могли достичь человеческой ловкости, им необходим такой масштаб данных, которого просто не существует. Винит Велмуруган, руководитель отдела обучения роботов в Encord и ветеран робототехнической лаборатории OpenAI, утверждает, что для прорыва требуется набор данных, примерно в пять раз превышающий весь видеоархив YouTube.

Текст в изобилии и его легко собирать. Физические данные должны производиться. Обучение только на основе видео часто не обеспечивает точности, необходимой для сложных манипуляций. Поэтому индустрия переключилась с доработки архитектуры моделей на решение гораздо более сложной задачи — производство высококачественных аннотированных физических данных.

Больше чем видео: использование мозговых волн и мышечных сигналов

Стартапы, такие как Encord, тестируют новые модальности данных, чтобы дать роботам более глубокий контекст. В рамках пилотного проекта с немецким нейробиологическим стартапом Zander Labs компания Encord оснащает операторов гарнитурами для считывания мозговых волн. Измеряя нейронную активность, исследователи надеются понять намерения, ошибки и моменты неожиданности.

Лукас Герке, нейробиолог из Zander, говорит, что отслеживание мозговой активности позволяет разработчикам моделей точно знать, когда роботу следует задействовать свои самые мощные вычислительные модели для выполнения сложной задачи.

Encord также исследует:

  • Электромиография (ЭМГ): датчики, закрепленные на предплечье, улавливают электрические сигналы в мышцах, создавая 3D-карту движений рук, которую часто упускают нательные камеры.
  • Системы «ведущий-ведомый»: пары роботизированных манипуляторов, где один имитирует действия человека-оператора, фиксируя точные движения, такие как наливание жидкости или складывание покерных фишек.
  • Плотная аннотация: метки вроде «правая рука затягивает болт». Велмуруган оценивает, что такая плотная аннотация в 100 раз ценнее, чем обычное видео от первого лица (ego-video) для обучения конкретным задачам.

Экономические реалии физического ИИ

Переход от ИИ, ориентированного на цифровые данные, к физическому ИИ меняет экономику машинного обучения. Лаборатории LLM создавали модели с почти нулевой предельной стоимостью, используя данные из интернета. Производство обучающих данных для роботов требует оборудования, операторов-людей и кропотливой аннотации. Encord стремится сделать высококачественные данные в 20 раз более рентабельными по сравнению с их ценностью, однако даже это превращает проекты в многомиллионные инвестиции для крупных парков роботов.

Компании, которые первыми создадут массивные, богато аннотированные наборы данных, будут доминировать в области автономного манипулирования — от подключения кабелей Ethernet до сортировки и упаковки товаров. Те, кто будет держаться только за видеопотоки, рискуют отстать, пока конкуренты собирают более богатые сигналы от человеческого тела и мозга.

Основные выводы

  • Производство данных против сбора данных: Физическому ИИ требуется дорогостоящее ручное производство высокоточных наборов данных, в отличие от LLM, которые собирают существующие данные из интернета.
  • Нейрологические модальности: Добавление мозговых волн и ЭМГ позволяет роботам эффективнее понимать намерения человека, ошибки и 3D-движения рук, чем при использовании только видео.
  • Проблема масштаба: Моделям робототехники требуется набор данных, гораздо больший, чем весь архив YouTube; генерация данных теперь является основным рубежом бизнеса.

Encord начала пилотный проект с немецким нейробиологическим стартапом Zander Labs, в рамках которого операторы используют гарнитуры для считывания мозговых волн и датчики ЭМГ на предплечьях для сбора высокоточных обучающих данных для физического ИИ. Цель партнерства — создать набор данных, объем которого в пять раз превысит общий объем видео на YouTube — масштаб, который, по словам исследователей, необходим для достижения роботами ловкости человеческого уровня и может изменить способы обучения робототехники.

Почему данные в робототехнике являются «узким местом»

Большие языковые модели развивались за счет сбора данных из открытого интернета; сырье было доступным и дешевым. Физический ИИ, напротив, нуждается в данных, которые необходимо производить. Каждое захватывание, поворот или наливание должно быть записано, аннотировано и связано с силами и намерениями, которые это вызвали. Обычное видео часто упускает тонкие нюансы, необходимые для сложных манипуляций, создавая разрыв между сегодняшними моделями и требованиями заводов, складов и домов.

Винит Велмуруган, руководитель отдела обучения роботов в Encord и бывший сотрудник робототехнической лаборатории OpenAI, утверждает, что область не сдвинется с места, пока не появится набор данных, примерно в пять раз превышающий видеоархив YouTube. Проблема больше не в архитектуре моделей; проблема в том, как производить данные.

Добавление мозговых волн и мышечных сигналов

Пилотный проект Encord-Zander пытается восполнить этот пробел, добавляя физиологические сигналы к видеозаписи. Операторы носят гарнитуры, считывающие электроэнцефалографию (ЭЭГ) — электрическую активность мозга, в то время как датчики ЭМГ на предплечье фиксируют мышечные импульсы. Цель состоит в том, чтобы определить ментальные состояния, такие как намерение, удивление или ошибка, и преобразовать необработанную мышечную активность в трехмерную карту движений руки, которую невозможно зафиксировать только с помощью видео.

Лукас Герке, нейробиолог в Zander, объясняет, что понимание того, когда человек ожидает сложную подзадачу, позволяет роботу задействовать свои самые мощные вычислительные модели в нужный момент.

Помимо нейроданных, Encord тестирует ряд дополнительных методов:

  • Электромиография (ЭМГ): Датчики на предплечье обеспечивают прямую считываемость активации мышц, позволяя точно реконструировать траектории пальцев, которые часто упускают налобные камеры.
  • Системы «ведущий-ведомый» (leader-follower rigs): Пара роботизированных манипуляторов работает в тандеме, при этом один повторяет движения оператора-человека. Это позволяет фиксировать выполнение деликатных задач — например, наливание жидкости или укладку чипов, — где важны ошибки в миллиметровом масштабе.
  • Плотная аннотация: Вместо того чтобы помечать только действия высокого уровня, команда Велмуругана добавляет детализированные дескрипторы, такие как «правая рука затягивает болт». По его оценкам, такая детализация примерно в 100 × ценнее для обучения конкретному навыку манипуляции, чем обычное эгоцентрическое видео.

Экономика производства данных

Физический ИИ (Physical AI) меняет финансовые расчеты в машинном обучении. Лаборатории LLM создавали модели с почти нулевыми предельными издержками, так как интернет предоставляет бесконечный объем текста. Однако производство данных для обучения роботов требует оборудования, операторов-людей и кропотливой аннотации. Внутренняя цель Encord — сделать высококачественные данные в 20 × более рентабельными по сравнению с ценностью, которую они приносят клиентам, но даже такая агрессивная эффективность все равно оборачивается многомиллионными проектами для крупномасштабных парков роботов.

Ставки высоки: компании, которые первыми смогут генерировать массивные, богато аннотированные наборы данных, будут доминировать на развивающемся рынке автономных манипуляций — будь то подключение кабелей Ethernet в залах дата-центров или сборка и упаковка товаров в распределительных центрах. Те, кто продолжит полагаться только на видеопотоки, рискуют отстать, в то время как конкуренты будут извлекать более богатые сигналы из человеческого тела и мозга.

Контраргументы и открытые вопросы

Не все убеждены, что нейросигналы — это недостающее звено. Критики утверждают, что дополнительная сложность оборудования может перевесить выгоду, особенно когда сочетание видео и датчиков силы-момента уже обеспечивает достойную производительность для многих промышленных задач. Масштабируемость — еще одна проблема: оснащение тысяч операторов гарнитурами ЭЭГ и установками ЭМГ может оказаться непосильным для мелких производителей.

Процесс генерации данных остается трудоемким. Даже с использованием систем «ведущий-ведомый» охват всего спектра задач, необходимых для создания по-настоящему универсального робота, потребует скоординированных и длительных усилий множества лабораторий и заводов. Рынку предстоит решить, оправдывают ли постепенные приросты производительности первоначальные инвестиции.

На что обратить внимание в дальнейшем

  • Вехи объема данных: Заявление Encord о наборе данных, в пять раз превышающем объем YouTube, станет конкретным ориентиром. Когда данные будут раскрыты, у других игроков появится четкая цель, которую нужно будет достичь или превзойти.
  • Темпы внедрения оборудования: Скорость, с которой устройства ЭЭГ и ЭМГ станут стандартом в установках для сбора данных, покажет, сможет ли этот подход масштабироваться за пределы экспериментальных пилотных проектов.
  • Метрики стоимости: Если Encord сможет наглядно продемонстрировать обещанное 20-кратное преимущество в стоимости, это может вызвать волну новых игроков, сосредоточенных на «производстве данных», а не на проектировании моделей.
  • Разрывы в производительности