La frontera de la IA física se enfrenta a un cuello de botella masivo: carecemos de datos de entrenamiento de alta fidelidad del mundo real. Los grandes modelos de lenguaje crecieron mediante la extracción de texto de internet; la robótica requiere un enfoque mucho más costoso.
El problema de la escasez de datos en la robótica
Para que los robots humanoides y de almacén alcancen la destreza humana, necesitan una escala de datos que simplemente no existe. Vineeth Velmurugan, jefe de aprendizaje robótico de Encord y veterano del laboratorio de robótica de OpenAI, afirma que para lograr un avance decisivo se requiere un conjunto de datos aproximadamente cinco veces mayor que todo el corpus de vídeos de YouTube.
El texto es abundante y gratuito de extraer. Los datos físicos deben fabricarse. El entrenamiento basado únicamente en vídeo a menudo carece de la fidelidad necesaria para la manipulación compleja. Por lo tanto, la industria ha pasado de ajustar la arquitectura de los modelos a resolver el problema mucho más difícil de fabricar datos físicos de alta calidad y anotados.
Más allá del vídeo: el uso de ondas cerebrales y señales musculares
Empresas emergentes como Encord están probando nuevas modalidades de datos para dotar a los robots de un contexto más profundo. En un proyecto piloto con la startup alemana de neurociencia Zander Labs, Encord equipa a los operadores con cascos de ondas cerebrales. Al medir la actividad neuronal, los investigadores esperan inferir la intención, el error y la sorpresa.
Lucas Gehrke, neurocientífico en Zander, afirma que el seguimiento de la actividad cerebral permite a los desarrolladores de modelos saber exactamente cuándo un robot debe activar sus modelos computacionales más potentes para una tarea difícil.
Encord también explora:
- Electromiografía (EMG): Sensores sujetos al antebrazo capturan señales eléctricas en los músculos, creando un mapa 3D de los movimientos de la mano que las cámaras montadas en la cabeza suelen pasar por alto.
- Sistemas líder-seguidor (Leader-Follower Rigs): Brazos robóticos emparejados donde uno imita a un operador humano, capturando acciones precisas como verter líquidos o apilar fichas de póker.
- Anotación densa: Etiquetas como "la mano derecha aprieta el perno". Velmurugan estima que esta anotación densa es 100 veces más valiosa que el vídeo subjetivo (ego video) sin procesar para el entrenamiento de tareas específicas.
La realidad económica de la IA física
Pasar de una IA centrada en lo digital a una IA física cambia la economía del aprendizaje automático. Los laboratorios de LLM construyeron modelos con un coste marginal cercano a cero extrayendo datos de la web. La producción de datos de entrenamiento para robots exige hardware, operadores humanos y una anotación minuciosa. Encord tiene como objetivo lograr que los datos de alta calidad sean 20 veces más rentables que su valor entregado; sin embargo, incluso eso se traduce en proyectos de millones de dólares para grandes flotas de robots.
Las empresas que generen primero conjuntos de datos masivos y ricamente anotados dominarán la manipulación autónoma, desde conectar cables Ethernet hasta la selección y el empaquetado de artículos. Aquellas que se aferren a procesos basados únicamente en vídeo corren el riesgo de quedarse atrás a medida que sus competidores recolectan señales más ricas del cuerpo y el cerebro humano.
Conclusiones clave
- Fabricación de datos frente a recopilación: La IA física requiere la fabricación manual y costosa de conjuntos de datos de alta fidelidad, a diferencia de los LLM que extraen datos existentes de internet.
- Modalidades neurológicas: La incorporación de ondas cerebrales y EMG permite que los robots comprendan la intención humana, el error y los movimientos de la mano en 3D de manera más eficaz que solo con vídeo.
- El desafío de la escala: Los modelos de robótica necesitan un conjunto de datos mucho más grande que todo el archivo de YouTube; la generación de datos es ahora la principal frontera comercial.
Encord ha iniciado un proyecto piloto con la startup alemana de neurociencia Zander Labs que equipa a los operadores con cascos de ondas cerebrales y sensores EMG en el antebrazo para capturar datos de entrenamiento de alta fidelidad para la IA física. La asociación tiene como objetivo producir un conjunto de datos lo suficientemente grande como para rivalizar con cinco veces el volumen total de vídeos de YouTube, una escala que, según los investigadores, es necesaria para que los robots alcancen una destreza de nivel humano y podría remodelar la forma en que aprende la robótica.
Por qué los datos de robótica son un cuello de botella
Los grandes modelos de lenguaje crecieron mediante la extracción de la web abierta; la materia prima era abundante y barata. La IA física, por el contrario, necesita datos que deben fabricarse. Cada agarre, giro o vertido debe ser registrado, anotado y vinculado a las fuerzas e intenciones que lo produjeron. El vídeo ordinario a menudo pierde las señales sutiles necesarias para la manipulación compleja, dejando una brecha entre los modelos actuales y las exigencias de fábricas, almacenes y hogares.
Vineeth Velmurugan, jefe de aprendizaje robótico de Encord y veterano del laboratorio de robótica de OpenAI, afirma que el campo no avanzará hasta que exista un conjunto de datos aproximadamente cinco veces mayor que el corpus de vídeos de YouTube. El problema ya no es la arquitectura del modelo; es cómo fabricar los datos.
Adding brain waves and muscle signals
The Encord-Zander pilot tries to fill that gap by adding physiological signals to the visual record. Operators wear headsets that read electroencephalography (EEG) – the brain’s electrical activity – while EMG sensors on the forearm capture muscle impulses. The goal is to infer mental states such as intent, surprise or error, and to translate raw muscle activity into a three-dimensional map of hand motion that video alone cannot capture.
Lucas Gehrke, a neuroscientist at Zander, explains that knowing when a human anticipates a difficult sub-task lets a robot allocate its most powerful computational models at the right moment.
Beyond neuro-data, Encord tests a handful of complementary techniques:
- Electromyography (EMG): Sensors on the forearm produce a live read-out of muscle activation, enabling a precise reconstruction of finger trajectories that head-mounted cameras often miss.
- Leader-follower rigs: A pair of robotic arms work in tandem, one mirroring a human operator’s motions. This captures delicate tasks—pouring liquids, stacking chips—where millimetre-scale errors matter.
- Dense annotation: Instead of labeling only high-level actions, Velmurugan’s team attaches fine-grained descriptors such as “right hand tightens bolt.” He estimates this detail is about 100 × more valuable for training a specific manipulation skill than raw ego-centric video.
The economics of data manufacturing
Physical AI changes the financial calculus of machine learning. LLM labs built models at near-zero marginal cost because the internet supplies endless text. Producing robot training data, however, requires hardware, human operators and painstaking annotation. Encord’s internal target is to make high-quality data 20 × more cost-effective than the value it delivers to customers, but even that aggressive efficiency still translates into multi-million-dollar projects for large-scale robot fleets.
The stakes are clear: companies that can generate massive, richly annotated datasets first will dominate the emerging market for autonomous manipulation—whether that means plugging in Ethernet cables on a data-center floor or picking and packing items in a distribution centre. Those that continue to rely on video-only pipelines risk falling behind as competitors extract richer signals from the human body and brain.
Counter-points and open questions
Not everyone is convinced that neuro-signals are the missing piece. Critics argue that the added hardware complexity could outweigh the benefits, especially when video plus force-torque sensors already deliver decent performance for many industrial tasks. Scalability is another concern: outfitting thousands of operators with EEG headsets and EMG rigs may prove prohibitive for smaller manufacturers.
The data-generation pipeline remains labor-intensive. Even with leader-follower rigs, capturing the breadth of tasks needed for a truly general robot will demand a sustained, coordinated effort across multiple labs and factories. The market will have to decide whether the incremental performance gains justify the upfront investment.
What to watch next
- Data volume milestones: Encord’s claim of a dataset five times the size of YouTube will be a concrete benchmark. When disclosed, other players will have a clear target to match or exceed.
- Hardware adoption rates: The speed at which EEG and EMG devices become standard in data-collection rigs will indicate whether the approach scales beyond experimental pilots.
- Cost metrics: If Encord can demonstrably deliver the promised 20-fold cost advantage, it could spur a wave of new entrants focused on “data manufacturing” rather than model design.
- Performance gaps
