Article: The frontier of physical AI hits a massive bottleneck: we lack high-fidelity, real-world training data. Large Language Models grew by scraping the internet’s text; robotics needs a far costlier approach.

The Data Scarcity Problem in Robotics

For humanoid and warehouse robots to match human dexterity, they need a data scale that simply isn’t there. Vineeth Velmurugan, Encord’s head of robot learning and a veteran of OpenAI’s robot lab, says breakthrough requires a dataset about five times the size of YouTube’s entire video corpus.

Text is abundant and free to scrape. Physical data must be manufactured. Training from video alone often misses the fidelity needed for complex manipulation. The industry has therefore shifted from tweaking model architecture to solving the much harder problem of manufacturing high-quality, annotated physical data.

Beyond Video: Using Brain Waves and Muscle Signals

Startups like Encord are testing new data modalities to give robots deeper context. In a pilot with German neuroscience startup Zander Labs, Encord equips operators with brain-wave headsets. By measuring neural activity, researchers hope to infer intent, error and surprise.

Lucas Gehrke, a neuroscientist at Zander, says tracking brain activity lets model builders know exactly when a robot should fire its most powerful computational models for a tough task.

Encord also explores:

  • Electromyography (EMG): Sensors strapped to the forearm capture electrical signals in muscles, creating a 3-D map of hand movements that head-mounted cameras often miss.
  • Leader-Follower Rigs: Paired robotic arms where one mimics a human operator, capturing precise actions such as pouring liquids or stacking poker chips.
  • Dense Annotation: Labels like “right hand tightens bolt.” Velmurugan estimates this dense annotation is 100 × more valuable than raw ego video for training specific tasks.

The Economic Reality of Physical AI

Moving from digital-first AI to physical AI flips the economics of machine learning. LLM labs built models at near-zero marginal cost by pulling from the web. Producing robot training data demands hardware, human operators and painstaking annotation. Encord aims to make high-quality data 20 × more cost-effective than its delivered value, yet even that translates into multi-million-dollar projects for large robot fleets.

Companies that generate massive, richly annotated datasets first will dominate autonomous manipulation—from plugging in Ethernet cables to picking and packing items. Those that cling to video-only pipelines risk falling behind as competitors harvest richer signals from the human body and brain.

Key Takeaways

  • Data Manufacturing vs. Collection: Physical AI requires the expensive, manual manufacturing of high-fidelity datasets, unlike LLMs that scrape existing internet data.
  • Neurological Modalities: Adding brain waves and EMG lets robots grasp human intent, error and 3-D hand movements more effectively than video alone.
  • The Scale Challenge: Robotics models need a dataset far larger than the entire YouTube archive; data generation is now the primary business frontier.

Encord has begun a pilot with German neuroscience startup Zander Labs that equips operators with brain-wave headsets and forearm EMG sensors to capture high-fidelity training data for physical AI. The partnership aims to produce a dataset large enough to rival five times the total volume of YouTube videos—a scale researchers say is required for robots to reach human-level dexterity and could reshape how robotics learns.

Why robotics data is a bottleneck

Large language models grew by scraping the open web; the raw material was abundant and cheap. Physical AI, by contrast, needs data that must be manufactured. Every grasp, twist or pour must be recorded, annotated and linked to the forces and intentions that produced it. Ordinary video often misses the subtle cues needed for complex manipulation, leaving a gap between today’s models and the demands of factories, warehouses and homes.

Vineeth Velmurugan, Encord’s head of robot learning and a former OpenAI robot-lab veteran, says the field will not move forward until a dataset roughly five times the size of YouTube’s video corpus exists. The problem is no longer model architecture; it is how to manufacture the data.

Menambah gelombang otak dan isyarat otot

Projek perintis Encord-Zander cuba mengisi jurang tersebut dengan menambah isyarat fisiologi kepada rekod visual. Operator memakai set kepala yang membaca elektroensefalografi (EEG) – aktiviti elektrik otak – manakala sensor EMG pada lengan bawah menangkap impuls otot. Matlamatnya adalah untuk membuat kesimpulan tentang keadaan mental seperti niat, kejutan atau ralat, dan untuk menterjemah aktiviti otot mentah kepada peta tiga dimensi pergerakan tangan yang tidak dapat ditangkap oleh video sahaja.

Lucas Gehrke, seorang pakar neurosains di Zander, menjelaskan bahawa mengetahui bila manusia menjangkakan sub-tugasan yang sukar membolehkan robot memperuntukkan model pengkomputeran paling berkuasanya pada saat yang tepat.

Selain daripada data neuro, Encord menguji beberapa teknik pelengkap:

  • Elektromiografi (EMG): Sensor pada lengan bawah menghasilkan bacaan langsung pengaktifan otot, membolehkan pembinaan semula trajektori jari yang tepat yang sering terlepas oleh kamera yang dipasang pada kepala.
  • Rangka kerja pemimpin-pengikut (leader-follower rigs): Sepasang lengan robotik bekerja secara serentak, dengan satu lengan meniru pergerakan operator manusia. Ini menangkap tugasan yang halus—menuang cecair, menyusun cip—di mana ralat berskala milimeter adalah penting.
  • Anotasi padat: Daripada hanya melabel tindakan tahap tinggi, pasukan Velmurugan menyertakan deskriptor terperinci seperti “tangan kanan mengetatkan bolt.” Beliau menganggarkan butiran ini adalah kira-kira 100 kali ganda lebih berharga untuk melatih kemahiran manipulasi tertentu berbanding video ego-sentrik mentah.

Ekonomi pembuatan data

AI Fizikal mengubah pengiraan kewangan pembelajaran mesin. Makmal LLM membina model pada kos marginal hampir sifar kerana internet membekalkan teks yang tidak terhingga. Walau bagaimanapun, menghasilkan data latihan robot memerlukan perkakasan, operator manusia dan anotasi yang teliti. Sasaran dalaman Encord adalah untuk menjadikan data berkualiti tinggi 20 kali ganda lebih kos efektif daripada nilai yang diberikannya kepada pelanggan, tetapi kecekapan agresif itu pun masih diterjemahkan kepada projek bernilai jutaan dolar untuk armada robot berskala besar.

Pertaruhannya jelas: syarikat yang dapat menjana set data yang besar dan dianotasi dengan kaya terlebih dahulu akan mendominasi pasaran manipulasi autonomi yang sedang muncul—sama ada ia bermaksud memasang kabel Ethernet di lantai pusat data atau mengambil dan membungkus barangan di pusat pengedaran. Mereka yang terus bergantung kepada saluran video sahaja berisiko ketinggalan apabila pesaing mengekstrak isyarat yang lebih kaya daripada badan dan otak manusia.

Hujah balas dan persoalan terbuka

Bukan semua orang yakin bahawa isyarat neuro adalah kepingan yang hilang. Pengkritik berpendapat bahawa kerumitan perkakasan tambahan boleh mengatasi manfaatnya, terutamanya apabila video ditambah dengan sensor daya-tork sudah memberikan prestasi yang memuaskan untuk banyak tugasan industri. Kebolehskalaan adalah kebimbangan lain: melengkapkan beribu-ribu operator dengan set kepala EEG dan rangka kerja EMG mungkin terbukti terlalu mahal bagi pengeluar yang lebih kecil.

Saluran penjanaan data kekal intensif buruh. Walaupun dengan rangka kerja pemimpin-pengikut, menangkap keluasan tugasan yang diperlukan untuk robot umum yang sebenar akan memerlukan usaha yang berterusan dan terkoordinasi merentasi pelbagai makmal dan kilang. Pasaran perlu memutuskan sama ada peningkatan prestasi secara berperingkat mewajarkan pelaburan pendahuluan.

Apa yang perlu diperhatikan seterusnya

  • Pencapaian volum data: Dakwaan Encord tentang set data lima kali ganda saiz YouTube akan menjadi penanda aras yang konkrit. Apabila didedahkan, pemain lain akan mempunyai sasaran yang jelas untuk ditandingi atau dilampaui.
  • Kadar penggunaan perkakasan: Kepantasan peranti EEG dan EMG menjadi standard dalam rangka kerja pengumpulan data akan menunjukkan sama ada pendekatan tersebut boleh diskalakan melampaui projek perintis eksperimen.
  • Metrik kos: Jika Encord dapat membuktikan kelebihan kos 20 kali ganda yang dijanjikan, ia boleh mencetuskan gelombang pendatang baharu yang menumpukan kepada “pembuatan data” dan bukannya reka bentuk model.
  • Jurang prestasi