Article: The frontier of physical AI hits a massive bottleneck: we lack high-fidelity, real-world training data. Large Language Models grew by scraping the internet’s text; robotics needs a far costlier approach.

The Data Scarcity Problem in Robotics

For humanoid and warehouse robots to match human dexterity, they need a data scale that simply isn’t there. Vineeth Velmurugan, Encord’s head of robot learning and a veteran of OpenAI’s robot lab, says breakthrough requires a dataset about five times the size of YouTube’s entire video corpus.

Text is abundant and free to scrape. Physical data must be manufactured. Training from video alone often misses the fidelity needed for complex manipulation. The industry has therefore shifted from tweaking model architecture to solving the much harder problem of manufacturing high-quality, annotated physical data.

Beyond Video: Using Brain Waves and Muscle Signals

Startups like Encord are testing new data modalities to give robots deeper context. In a pilot with German neuroscience startup Zander Labs, Encord equips operators with brain-wave headsets. By measuring neural activity, researchers hope to infer intent, error and surprise.

Lucas Gehrke, a neuroscientist at Zander, says tracking brain activity lets model builders know exactly when a robot should fire its most powerful computational models for a tough task.

Encord also explores:

  • Electromyography (EMG): Sensors strapped to the forearm capture electrical signals in muscles, creating a 3-D map of hand movements that head-mounted cameras often miss.
  • Leader-Follower Rigs: Paired robotic arms where one mimics a human operator, capturing precise actions such as pouring liquids or stacking poker chips.
  • Dense Annotation: Labels like “right hand tightens bolt.” Velmurugan estimates this dense annotation is 100 × more valuable than raw ego video for training specific tasks.

The Economic Reality of Physical AI

Moving from digital-first AI to physical AI flips the economics of machine learning. LLM labs built models at near-zero marginal cost by pulling from the web. Producing robot training data demands hardware, human operators and painstaking annotation. Encord aims to make high-quality data 20 × more cost-effective than its delivered value, yet even that translates into multi-million-dollar projects for large robot fleets.

Companies that generate massive, richly annotated datasets first will dominate autonomous manipulation—from plugging in Ethernet cables to picking and packing items. Those that cling to video-only pipelines risk falling behind as competitors harvest richer signals from the human body and brain.

Key Takeaways

  • Data Manufacturing vs. Collection: Physical AI requires the expensive, manual manufacturing of high-fidelity datasets, unlike LLMs that scrape existing internet data.
  • Neurological Modalities: Adding brain waves and EMG lets robots grasp human intent, error and 3-D hand movements more effectively than video alone.
  • The Scale Challenge: Robotics models need a dataset far larger than the entire YouTube archive; data generation is now the primary business frontier.

Encord has begun a pilot with German neuroscience startup Zander Labs that equips operators with brain-wave headsets and forearm EMG sensors to capture high-fidelity training data for physical AI. The partnership aims to produce a dataset large enough to rival five times the total volume of YouTube videos—a scale researchers say is required for robots to reach human-level dexterity and could reshape how robotics learns.

Why robotics data is a bottleneck

Large language models grew by scraping the open web; the raw material was abundant and cheap. Physical AI, by contrast, needs data that must be manufactured. Every grasp, twist or pour must be recorded, annotated and linked to the forces and intentions that produced it. Ordinary video often misses the subtle cues needed for complex manipulation, leaving a gap between today’s models and the demands of factories, warehouses and homes.

Vineeth Velmurugan, Encord’s head of robot learning and a former OpenAI robot-lab veteran, says the field will not move forward until a dataset roughly five times the size of YouTube’s video corpus exists. The problem is no longer model architecture; it is how to manufacture the data.

Menambahkan gelombang otak dan sinyal otot

Pilot Encord-Zander mencoba mengisi celah tersebut dengan menambahkan sinyal fisiologis ke dalam rekaman visual. Operator mengenakan headset yang membaca elektroensefalografi (EEG) – aktivitas listrik otak – sementara sensor EMG pada lengan bawah menangkap impuls otot. Tujuannya adalah untuk menyimpulkan keadaan mental seperti niat, kejutan, atau kesalahan, dan menerjemahkan aktivitas otot mentah menjadi peta gerakan tangan tiga dimensi yang tidak dapat ditangkap oleh video saja.

Lucas Gehrke, seorang neurosaintis di Zander, menjelaskan bahwa mengetahui kapan manusia mengantisipasi sub-tugas yang sulit memungkinkan robot untuk mengalokasikan model komputasi paling kuatnya pada saat yang tepat.

Selain data neuro, Encord menguji sejumlah teknik pelengkap:

  • Electromyography (EMG): Sensor pada lengan bawah menghasilkan pembacaan langsung dari aktivasi otot, memungkinkan rekonstruksi presisi lintasan jari yang sering kali terlewatkan oleh kamera yang terpasang di kepala.
  • Leader-follower rigs: Sepasang lengan robot bekerja secara tandem, salah satunya meniru gerakan operator manusia. Ini menangkap tugas-tugas halus—menuangkan cairan, menumpuk chip—di mana kesalahan skala milimeter sangat berpengaruh.
  • Dense annotation: Alih-alih hanya melabeli tindakan tingkat tinggi, tim Velmurugan menyertakan deskriptor yang terperinci seperti “tangan kanan mengencangkan baut.” Ia memperkirakan detail ini sekitar 100 kali lebih berharga untuk melatih keterampilan manipulasi tertentu dibandingkan video ego-sentris mentah.

Ekonomi manufaktur data

AI fisik mengubah kalkulasi finansial dari pembelajaran mesin. Lab LLM membangun model dengan biaya marginal mendekati nol karena internet menyediakan teks yang tak ada habisnya. Namun, memproduksi data pelatihan robot memerlukan perangkat keras, operator manusia, dan anotasi yang teliti. Target internal Encord adalah membuat data berkualitas tinggi 20 kali lebih hemat biaya dibandingkan nilai yang diberikannya kepada pelanggan, tetapi efisiensi agresif tersebut pun tetap diterjemahkan menjadi proyek bernilai jutaan dolar untuk armada robot skala besar.

Taruhannya jelas: perusahaan yang dapat menghasilkan dataset masif dengan anotasi kaya terlebih dahulu akan mendominasi pasar manipulasi otonom yang sedang berkembang—baik itu memasang kabel Ethernet di lantai pusat data atau mengambil dan mengemas barang di pusat distribusi. Mereka yang terus mengandalkan alur kerja (pipeline) berbasis video saja berisiko tertinggal saat pesaing mengekstraksi sinyal yang lebih kaya dari tubuh dan otak manusia.

Argumen penyeimbang dan pertanyaan terbuka

Tidak semua orang yakin bahwa sinyal neuro adalah kepingan yang hilang. Para kritikus berpendapat bahwa kompleksitas perangkat keras tambahan dapat melebihi manfaatnya, terutama ketika video ditambah sensor gaya-torsi (force-torque) sudah memberikan performa yang memadai untuk banyak tugas industri. Skalabilitas adalah kekhawatiran lainnya: melengkapi ribuan operator dengan headset EEG dan perangkat EMG mungkin terbukti terlalu mahal bagi produsen yang lebih kecil.

Alur kerja pembuatan data tetap padat karya. Bahkan dengan perangkat leader-follower, menangkap cakupan tugas yang dibutuhkan untuk robot yang benar-benar umum akan menuntut upaya yang berkelanjutan dan terkoordinasi di berbagai lab dan pabrik. Pasar harus memutuskan apakah peningkatan performa inkremental tersebut sebanding dengan investasi awal yang dikeluarkan.

Apa yang perlu diperhatikan selanjutnya

  • Milestone volume data: Klaim Encord tentang dataset yang lima kali lebih besar dari YouTube akan menjadi tolok ukur yang nyata. Saat diungkapkan, pemain lain akan memiliki target yang jelas untuk disamai atau dilampaui.
  • Tingkat adopsi perangkat keras: Kecepatan perangkat EEG dan EMG menjadi standar dalam perangkat pengumpulan data akan menunjukkan apakah pendekatan ini dapat diskalakan melampaui pilot eksperimental.
  • Metrik biaya: Jika Encord dapat membuktikan keunggulan biaya 20 kali lipat yang dijanjikan, hal ini dapat memicu gelombang pendatang baru yang berfokus pada “manufaktur data” daripada desain model.
  • Kesenjangan performa