Die Grenze der Physical AI stößt auf einen massiven Engpass: Es mangelt an hochpräzisen Trainingsdaten aus der realen Welt. Large Language Models wuchsen durch das Scraping von Internettexten; die Robotik benötigt einen weitaus kostspieligeren Ansatz.
Das Problem der Datenknappheit in der Robotik
Damit humanoide Roboter und Lagerroboter die Geschicklichkeit von Menschen erreichen können, benötigen sie einen Datenumfang, der schlichtweg nicht existiert. Vineeth Velmurugan, Leiter des Bereichs Robot Learning bei Encord und Veteran des Robotik-Labors von OpenAI, sagt, dass ein Durchbruch einen Datensatz erfordert, der etwa fünfmal so groß ist wie der gesamte Videokorpus von YouTube.
Text ist im Überfluss vorhanden und lässt sich kostenlos scrapen. Physische Daten müssen hingegen hergestellt werden. Das Training allein auf Basis von Videos lässt oft die Präzision vermissen, die für komplexe Manipulationen erforderlich ist. Die Branche hat sich daher von der Optimierung der Modellarchitektur hin zur Lösung des weitaus schwierigeren Problems der Herstellung hochwertiger, annotierter physischer Daten verlagert.
Jenseits von Video: Nutzung von Gehirnwellen und Muskelsignalen
Startups wie Encord testen neue Datenmodalitäten, um Robotern einen tieferen Kontext zu vermitteln. In einem Pilotprojekt mit dem deutschen Neurowissenschafts-Startup Zander Labs stattet Encord die Bediener mit Gehirnwellen-Headsets aus. Durch die Messung neuronaler Aktivitäten hoffen Forscher, Absichten, Fehler und Überraschungen ableiten zu können.
Lucas Gehrke, Neurowissenschaftler bei Zander, erklärt, dass die Verfolgung der Gehirnaktivität es den Modellentwicklern ermöglicht, genau zu wissen, wann ein Roboter seine leistungsfähigsten Rechenmodelle für eine schwierige Aufgabe aktivieren sollte.
Encord erforscht zudem:
- Elektromyografie (EMG): Am Unterarm befestigte Sensoren erfassen elektrische Signale in den Muskeln und erstellen so eine 3D-Karte der Handbewegungen, die von Kopfkameras oft nicht erfasst werden können.
- Leader-Follower-Systeme: Gepaarte Roboterarme, bei denen einer einen menschlichen Bediener imitiert und präzise Handlungen wie das Gießen von Flüssigkeiten oder das Stapeln von Pokerchips erfasst.
- Dichte Annotation: Labels wie „rechte Hand zieht Bolzen fest“. Velmurugan schätzt, dass diese dichte Annotation für das Training spezifischer Aufgaben 100-mal wertvoller ist als rohe Ego-Videos.
Die wirtschaftliche Realität der Physical AI
Der Übergang von einer Digital-First-KI zur Physical AI kehrt die Wirtschaftlichkeit des maschinellen Lernens um. LLM-Labore bauten Modelle mit nahezu null Grenzkosten auf, indem sie Daten aus dem Web bezogen. Die Produktion von Robotik-Trainingsdaten erfordert Hardware, menschliche Bediener und mühsame Annotationen. Encord strebt danach, hochwertige Daten 20-mal kosteneffizienter im Verhältnis zu ihrem gelieferten Wert zu machen, doch selbst das bedeutet für große Roboterflotten Projekte in Millionenhöhe.
Unternehmen, die zuerst massive, reich annotierte Datensätze generieren, werden die autonome Manipulation dominieren – vom Einstecken von Ethernet-Kabeln bis hin zum Kommissionieren und Verpacken von Artikeln. Diejenigen, die an reinen Video-Pipelines festhalten, riskieren den Anschluss zu verlieren, während die Konkurrenz reichhaltigere Signale vom menschlichen Körper und Gehirn gewinnt.
Wichtigste Erkenntnisse
- Datenherstellung vs. Datensammlung: Im Gegensatz zu LLMs, die bestehende Internetdaten scrapen, erfordert Physical AI die teure, manuelle Herstellung hochpräziser Datensätze.
- Neurologische Modalitäten: Die Hinzunahme von Gehirnwellen und EMG ermöglicht es Robotern, menschliche Absichten, Fehler und 3D-Handbewegungen effektiver zu erfassen als allein durch Video.
- Die Herausforderung der Skalierung: Robotik-Modelle benötigen einen Datensatz, der weitaus größer ist als das gesamte YouTube-Archiv; die Datengenerierung ist nun die primäre geschäftliche Grenze.
Encord hat ein Pilotprojekt mit dem deutschen Neurowissenschafts-Startup Zander Labs gestartet, bei dem die Bediener mit Gehirnwellen-Headsets und EMG-Sensoren am Unterarm ausgestattet werden, um hochpräzise Trainingsdaten für Physical AI zu erfassen. Ziel der Partnerschaft ist es, einen Datensatz zu erstellen, der groß genug ist, um das fünffache des gesamten YouTube-Video-Volumens zu erreichen – ein Maßstab, von dem Forscher sagen, dass er erforderlich ist, damit Roboter menschliche Geschicklichkeit erreichen können, was die Art und Weise, wie Robotik lernt, grundlegend verändern könnte.
Warum Robotik-Daten ein Engpass sind
Large Language Models wuchsen durch das Scraping des offenen Webs; das Rohmaterial war im Überfluss vorhanden und günstig. Physical AI hingegen benötigt Daten, die hergestellt werden müssen. Jeder Griff, jede Drehung oder jeder Gießvorgang muss aufgezeichnet, annotiert und mit den Kräften und Absichten verknüpft werden, die ihn hervorgerufen haben. Gewöhnliche Videos übersehen oft die subtilen Hinweise, die für komplexe Manipulationen erforderlich sind, wodurch eine Lücke zwischen den heutigen Modellen und den Anforderungen in Fabriken, Lagern und Haushalten entsteht.
Vineeth Velmurugan, Leiter des Bereichs Robot Learning bei Encord und ehemaliger Veteran des OpenAI-Robotik-Labors, sagt, dass sich das Feld nicht weiterentwickeln wird, bis ein Datensatz existiert, der etwa fünfmal so groß ist wie der Videokorpus von YouTube. Das Problem ist nicht mehr die Modellarchitektur; es geht darum, wie man die Daten herstellt.
Adding brain waves and muscle signals
The Encord-Zander pilot tries to fill that gap by adding physiological signals to the visual record. Operators wear headsets that read electroencephalography (EEG) – the brain’s electrical activity – while EMG sensors on the forearm capture muscle impulses. The goal is to infer mental states such as intent, surprise or error, and to translate raw muscle activity into a three-dimensional map of hand motion that video alone cannot capture.
Lucas Gehrke, a neuroscientist at Zander, explains that knowing when a human anticipates a difficult sub-task lets a robot allocate its most powerful computational models at the right moment.
Beyond neuro-data, Encord tests a handful of complementary techniques:
- Electromyography (EMG): Sensors on the forearm produce a live read-out of muscle activation, enabling a precise reconstruction of finger trajectories that head-mounted cameras often miss.
- Leader-follower rigs: A pair of robotic arms work in tandem, one mirroring a human operator’s motions. This captures delicate tasks—pouring liquids, stacking chips—where millimetre-scale errors matter.
- Dense annotation: Instead of labeling only high-level actions, Velmurugan’s team attaches fine-grained descriptors such as “right hand tightens bolt.” He estimates this detail is about 100 × more valuable for training a specific manipulation skill than raw ego-centric video.
The economics of data manufacturing
Physical AI changes the financial calculus of machine learning. LLM labs built models at near-zero marginal cost because the internet supplies endless text. Producing robot training data, however, requires hardware, human operators and painstaking annotation. Encord’s internal target is to make high-quality data 20 × more cost-effective than the value it delivers to customers, but even that aggressive efficiency still translates into multi-million-dollar projects for large-scale robot fleets.
The stakes are clear: companies that can generate massive, richly annotated datasets first will dominate the emerging market for autonomous manipulation—whether that means plugging in Ethernet cables on a data-center floor or picking and packing items in a distribution centre. Those that continue to rely on video-only pipelines risk falling behind as competitors extract richer signals from the human body and brain.
Counter-points and open questions
Not everyone is convinced that neuro-signals are the missing piece. Critics argue that the added hardware complexity could outweigh the benefits, especially when video plus force-torque sensors already deliver decent performance for many industrial tasks. Scalability is another concern: outfitting thousands of operators with EEG headsets and EMG rigs may prove prohibitive for smaller manufacturers.
The data-generation pipeline remains labor-intensive. Even with leader-follower rigs, capturing the breadth of tasks needed for a truly general robot will demand a sustained, coordinated effort across multiple labs and factories. The market will have to decide whether the incremental performance gains justify the upfront investment.
What to watch next
- Data volume milestones: Encord’s claim of a dataset five times the size of YouTube will be a concrete benchmark. When disclosed, other players will have a clear target to match or exceed.
- Hardware adoption rates: The speed at which EEG and EMG devices become standard in data-collection rigs will indicate whether the approach scales beyond experimental pilots.
- Cost metrics: If Encord can demonstrably deliver the promised 20-fold cost advantage, it could spur a wave of new entrants focused on “data manufacturing” rather than model design.
- Performance gaps
