La frontière de l'IA physique se heurte à un goulot d'étranglement massif : nous manquons de données d'entraînement haute fidélité issues du monde réel. Les grands modèles de langage (LLM) se sont développés en aspirant le texte d'Internet ; la robotique nécessite une approche bien plus coûteuse.

Le problème de la rareté des données en robotique

Pour que les robots humanoïdes et d'entrepôt égalent la dextérité humaine, ils ont besoin d'une échelle de données qui n'existe tout simplement pas. Vineeth Velmurugan, responsable de l'apprentissage robotique chez Encord et ancien membre du laboratoire de robotique d'OpenAI, affirme qu'une percée nécessite un ensemble de données environ cinq fois plus important que l'ensemble du corpus vidéo de YouTube.

Le texte est abondant et gratuit à aspirer. Les données physiques doivent être fabriquées. L'entraînement basé uniquement sur la vidéo manque souvent de la fidélité nécessaire aux manipulations complexes. L'industrie est donc passée de l'optimisation de l'architecture des modèles à la résolution d'un problème bien plus difficile : la fabrication de données physiques de haute qualité et annotées.

Au-delà de la vidéo : utiliser les ondes cérébrales et les signaux musculaires

Des startups comme Encord testent de nouvelles modalités de données pour donner aux robots un contexte plus profond. Lors d'un projet pilote avec la startup allemande de neurosciences Zander Labs, Encord équipe les opérateurs de casques d'ondes cérébrales. En mesurant l'activité neuronale, les chercheurs espèrent déduire l'intention, l'erreur et la surprise.

Lucas Gehrke, neuroscientifique chez Zander, explique que le suivi de l'activité cérébrale permet aux concepteurs de modèles de savoir exactement quand un robot doit activer ses modèles de calcul les plus puissants pour une tâche difficile.

Encord explore également :

  • Électromyographie (EMG) : Des capteurs fixés sur l'avant-bras capturent les signaux électriques des muscles, créant une carte en 3D des mouvements de la main que les caméras montées sur la tête manquent souvent.
  • Dispositifs Leader-Follower : Des bras robotiques appariés où l'un imite un opérateur humain, capturant des actions précises telles que le versement de liquides ou l'empilement de jetons de poker.
  • Annotation dense : Des étiquettes telles que « la main droite resserre le boulon ». Velmurugan estime que cette annotation dense est 100 fois plus précieuse que la vidéo brute en vue subjective (ego video) pour l'entraînement de tâches spécifiques.

La réalité économique de l'IA physique

Passer d'une IA axée sur le numérique à une IA physique inverse l'économie de l'apprentissage automatique. Les laboratoires de LLM ont construit des modèles à un coût marginal proche de zéro en puisant sur le web. La production de données d'entraînement pour robots exige du matériel, des opérateurs humains et une annotation minutieuse. Encord vise à rendre les données de haute qualité 20 fois plus rentables par rapport à la valeur livrée, mais même cela se traduit par des projets de plusieurs millions de dollars pour les grandes flottes de robots.

Les entreprises qui généreront les premiers ensembles de données massifs et richement annotés domineront la manipulation autonome — du branchement de câbles Ethernet à la préparation et l'emballage d'articles. Celles qui s'accrochent à des pipelines uniquement basés sur la vidéo risquent d'être distancées par des concurrents qui récoltent des signaux plus riches provenant du corps et du cerveau humains.

Points clés à retenir

  • Fabrication de données vs Collecte : L'IA physique nécessite la fabrication manuelle et coûteuse d'ensembles de données haute fidélité, contrairement aux LLM qui aspirent les données existantes sur Internet.
  • Modalités neurologiques : L'ajout des ondes cérébrales et de l'EMG permet aux robots de mieux saisir l'intention humaine, l'erreur et les mouvements de la main en 3D que la vidéo seule.
  • Le défi de l'échelle : Les modèles de robotique ont besoin d'un ensemble de données bien plus vaste que l'intégralité des archives de YouTube ; la génération de données est désormais la principale frontière commerciale.

Encord a lancé un projet pilote avec la startup allemande de neurosciences Zander Labs qui équipe les opérateurs de casques d'ondes cérébrales et de capteurs EMG sur l'avant-bras afin de capturer des données d'entraînement haute fidélité pour l'IA physique. Le partenariat vise à produire un ensemble de données assez vaste pour rivaliser avec cinq fois le volume total des vidéos YouTube — une échelle que les chercheurs jugent nécessaire pour que les robots atteignent une dextérité de niveau humain et qui pourrait transformer la manière dont la robotique apprend.

Pourquoi les données de robotique constituent un goulot d'étranglement

Les grands modèles de langage se sont développés en aspirant le web ouvert ; la matière première était abondante et bon marché. L'IA physique, en revanche, nécessite des données qui doivent être fabriquées. Chaque saisie, torsion ou versement doit être enregistré, annoté et lié aux forces et aux intentions qui l'ont produit. La vidéo ordinaire manque souvent des indices subtils nécessaires à une manipulation complexe, laissant un fossé entre les modèles actuels et les exigences des usines, des entrepôts et des foyers.

Vineeth Velmurugan, responsable de l'apprentissage robotique chez Encord et ancien membre du laboratoire de robotique d'OpenAI, affirme que le domaine n'avancera pas tant qu'un ensemble de données environ cinq fois plus grand que le corpus vidéo de YouTube n'existera pas. Le problème n'est plus l'architecture du modèle ; c'est la manière de fabriquer les données.

Adding brain waves and muscle signals

The Encord-Zander pilot tries to fill that gap by adding physiological signals to the visual record. Operators wear headsets that read electroencephalography (EEG) – the brain’s electrical activity – while EMG sensors on the forearm capture muscle impulses. The goal is to infer mental states such as intent, surprise or error, and to translate raw muscle activity into a three-dimensional map of hand motion that video alone cannot capture.

Lucas Gehrke, a neuroscientist at Zander, explains that knowing when a human anticipates a difficult sub-task lets a robot allocate its most powerful computational models at the right moment.

Beyond neuro-data, Encord tests a handful of complementary techniques:

  • Electromyography (EMG): Sensors on the forearm produce a live read-out of muscle activation, enabling a precise reconstruction of finger trajectories that head-mounted cameras often miss.
  • Leader-follower rigs: A pair of robotic arms work in tandem, one mirroring a human operator’s motions. This captures delicate tasks—pouring liquids, stacking chips—where millimetre-scale errors matter.
  • Dense annotation: Instead of labeling only high-level actions, Velmurugan’s team attaches fine-grained descriptors such as “right hand tightens bolt.” He estimates this detail is about 100 × more valuable for training a specific manipulation skill than raw ego-centric video.

The economics of data manufacturing

Physical AI changes the financial calculus of machine learning. LLM labs built models at near-zero marginal cost because the internet supplies endless text. Producing robot training data, however, requires hardware, human operators and painstaking annotation. Encord’s internal target is to make high-quality data 20 × more cost-effective than the value it delivers to customers, but even that aggressive efficiency still translates into multi-million-dollar projects for large-scale robot fleets.

The stakes are clear: companies that can generate massive, richly annotated datasets first will dominate the emerging market for autonomous manipulation—whether that means plugging in Ethernet cables on a data-center floor or picking and packing items in a distribution centre. Those that continue to rely on video-only pipelines risk falling behind as competitors extract richer signals from the human body and brain.

Counter-points and open questions

Not everyone is convinced that neuro-signals are the missing piece. Critics argue that the added hardware complexity could outweigh the benefits, especially when video plus force-torque sensors already deliver decent performance for many industrial tasks. Scalability is another concern: outfitting thousands of operators with EEG headsets and EMG rigs may prove prohibitive for smaller manufacturers.

The data-generation pipeline remains labor-intensive. Even with leader-follower rigs, capturing the breadth of tasks needed for a truly general robot will demand a sustained, coordinated effort across multiple labs and factories. The market will have to decide whether the incremental performance gains justify the upfront investment.

What to watch next

  • Data volume milestones: Encord’s claim of a dataset five times the size of YouTube will be a concrete benchmark. When disclosed, other players will have a clear target to match or exceed.
  • Hardware adoption rates: The speed at which EEG and EMG devices become standard in data-collection rigs will indicate whether the approach scales beyond experimental pilots.
  • Cost metrics: If Encord can demonstrably deliver the promised 20-fold cost advantage, it could spur a wave of new entrants focused on “data manufacturing” rather than model design.
  • Performance gaps