La frontiera dell'IA fisica si scontra con un enorme collo di bottiglia: la mancanza di dati di addestramento ad alta fedeltà del mondo reale. I Large Language Model sono cresciuti tramite lo scraping dei testi presenti su Internet; la robotica richiede un approccio molto più costoso.

Il problema della scarsità di dati nella robotica

Affinché i robot umanoidi e quelli per i magazzini possano eguagliare la destrezza umana, hanno bisogno di una scala di dati che semplicemente non esiste. Vineeth Velmurugan, responsabile del robot learning di Encord e veterano del laboratorio robotico di OpenAI, afferma che per una svolta decisiva è necessario un dataset circa cinque volte più grande dell'intero corpus video di YouTube.

Il testo è abbondante e gratuito da raccogliere tramite scraping. I dati fisici devono essere prodotti. L'addestramento basato solo sui video spesso non raggiunge la fedeltà necessaria per la manipolazione complessa. L'industria si è quindi spostata dal perfezionamento dell'architettura dei modelli alla risoluzione del problema molto più difficile della produzione di dati fisici di alta qualità e annotati.

Oltre il video: l'uso di onde cerebrali e segnali muscolari

Startup come Encord stanno testando nuove modalità di dati per fornire ai robot un contesto più profondo. In un progetto pilota con la startup tedesca di neuroscienze Zander Labs, Encord fornisce agli operatori visori per onde cerebrali. Misurando l'attività neurale, i ricercatori sperano di inferire l'intento, l'errore e la sorpresa.

Lucas Gehrke, neuroscienziato presso Zander, afferma che il monitoraggio dell'attività cerebrale permette ai progettisti di modelli di sapere esattamente quando un robot debba attivare i suoi modelli computazionali più potenti per un compito difficile.

Encord esplora anche:

  • Elettromiografia (EMG): Sensori applicati all'avambraccio catturano i segnali elettrici nei muscoli, creando una mappa 3D dei movimenti della mano che le telecamere montate sulla testa spesso non riescono a cogliere.
  • Sistemi Leader-Follower: Bracci robotici accoppiati in cui uno imita un operatore umano, catturando azioni precise come versare liquidi o impilare fiches da poker.
  • Annotazione densa: Etichette come "la mano destra stringe il bullone". Velmurugan stima che questa annotazione densa sia 100 volte più preziosa dei video ego-centrici grezzi per l'addestramento di compiti specifici.

La realtà economica dell'IA fisica

Il passaggio da un'IA "digital-first" a un'IA fisica ribalta l'economia del machine learning. I laboratori di LLM hanno costruito modelli con un costo marginale vicino allo zero attingendo dal web. La produzione di dati per l'addestramento dei robot richiede hardware, operatori umani e un'annotazione meticolosa. Encord punta a rendere i dati di alta qualità 20 volte più convenienti rispetto al valore che offrono, eppure anche questo si traduce in progetti da milioni di dollari per grandi flotte di robot.

Le aziende che per prime genereranno dataset massicci e riccamente annotati domineranno la manipolazione autonoma, dal collegare cavi Ethernet al prelievo e imballaggio di articoli. Quelle che si aggrappano a pipeline basate solo su video rischiano di restare indietro mentre i concorrenti raccolgono segnali più ricchi dal corpo e dal cervello umano.

Punti chiave

  • Produzione vs. Raccolta di dati: L'IA fisica richiede la costosa produzione manuale di dataset ad alta fedeltà, a differenza degli LLM che effettuano lo scraping di dati internet esistenti.
  • Modalità neurologiche: L'aggiunta di onde cerebrali ed EMG consente ai robot di comprendere l'intento umano, l'errore e i movimenti 3D delle mani in modo più efficace rispetto al solo video.
  • La sfida della scala: I modelli di robotica necessitano di un dataset molto più grande dell'intero archivio di YouTube; la generazione di dati è ora la principale frontiera commerciale.

Encord ha avviato un progetto pilota con la startup tedesca di neuroscienze Zander Labs che equipaggia gli operatori con visori per onde cerebrali e sensori EMG per l'avambraccio per catturare dati di addestramento ad alta fedeltà per l'IA fisica. La partnership mira a produrre un dataset abbastanza grande da rivaleggiare con cinque volte il volume totale dei video di YouTube: una scala che, secondo i ricercatori, è necessaria affinché i robot raggiungano una destrezza di livello umano e potrebbe trasformare il modo in cui la robotica apprende.

Perché i dati della robotica sono un collo di bottiglia

I grandi modelli linguistici sono cresciuti tramite lo scraping del web aperto; la materia prima era abbondante ed economica. L'IA fisica, al contrario, necessita di dati che devono essere prodotti. Ogni presa, torsione o versamento deve essere registrato, annotato e collegato alle forze e alle intenzioni che lo hanno prodotto. I video ordinari spesso non colgono i segnali sottili necessari per la manipolazione complessa, lasciando un divario tra i modelli odierni e le esigenze di fabbriche, magazzini e case.

Vineeth Velmurugan, responsabile del robot learning di Encord e veterano del laboratorio robotico di OpenAI, afferma che il settore non farà progressi finché non esisterà un dataset di circa cinque volte la dimensione del corpus video di YouTube. Il problema non è più l'architettura del modello; è come produrre i dati.

Adding brain waves and muscle signals

The Encord-Zander pilot tries to fill that gap by adding physiological signals to the visual record. Operators wear headsets that read electroencephalography (EEG) – the brain’s electrical activity – while EMG sensors on the forearm capture muscle impulses. The goal is to infer mental states such as intent, surprise or error, and to translate raw muscle activity into a three-dimensional map of hand motion that video alone cannot capture.

Lucas Gehrke, a neuroscientist at Zander, explains that knowing when a human anticipates a difficult sub-task lets a robot allocate its most powerful computational models at the right moment.

Beyond neuro-data, Encord tests a handful of complementary techniques:

  • Electromyography (EMG): Sensors on the forearm produce a live read-out of muscle activation, enabling a precise reconstruction of finger trajectories that head-mounted cameras often miss.
  • Leader-follower rigs: A pair of robotic arms work in tandem, one mirroring a human operator’s motions. This captures delicate tasks—pouring liquids, stacking chips—where millimetre-scale errors matter.
  • Dense annotation: Instead of labeling only high-level actions, Velmurugan’s team attaches fine-grained descriptors such as “right hand tightens bolt.” He estimates this detail is about 100 × more valuable for training a specific manipulation skill than raw ego-centric video.

The economics of data manufacturing

Physical AI changes the financial calculus of machine learning. LLM labs built models at near-zero marginal cost because the internet supplies endless text. Producing robot training data, however, requires hardware, human operators and painstaking annotation. Encord’s internal target is to make high-quality data 20 × more cost-effective than the value it delivers to customers, but even that aggressive efficiency still translates into multi-million-dollar projects for large-scale robot fleets.

The stakes are clear: companies that can generate massive, richly annotated datasets first will dominate the emerging market for autonomous manipulation—whether that means plugging in Ethernet cables on a data-center floor or picking and packing items in a distribution centre. Those that continue to rely on video-only pipelines risk falling behind as competitors extract richer signals from the human body and brain.

Counter-points and open questions

Not everyone is convinced that neuro-signals are the missing piece. Critics argue that the added hardware complexity could outweigh the benefits, especially when video plus force-torque sensors already deliver decent performance for many industrial tasks. Scalability is another concern: outfitting thousands of operators with EEG headsets and EMG rigs may prove prohibitive for smaller manufacturers.

The data-generation pipeline remains labor-intensive. Even with leader-follower rigs, capturing the breadth of tasks needed for a truly general robot will demand a sustained, coordinated effort across multiple labs and factories. The market will have to decide whether the incremental performance gains justify the upfront investment.

What to watch next

  • Data volume milestones: Encord’s claim of a dataset five times the size of YouTube will be a concrete benchmark. When disclosed, other players will have a clear target to match or exceed.
  • Hardware adoption rates: The speed at which EEG and EMG devices become standard in data-collection rigs will indicate whether the approach scales beyond experimental pilots.
  • Cost metrics: If Encord can demonstrably deliver the promised 20-fold cost advantage, it could spur a wave of new entrants focused on “data manufacturing” rather than model design.
  • Performance gaps