مرزهای هوش مصنوعی فیزیکی با یک گلوگاه بزرگ روبرو شده است: ما با کمبود داده‌های آموزشی با دقت بالا از دنیای واقعی مواجه هستیم. مدل‌های زبانی بزرگ با استخراج متن از اینترنت رشد کردند؛ اما رباتیک به رویکردی بسیار پرهزینه‌تر نیاز دارد.

مشکل کمبود داده در رباتیک

برای اینکه ربات‌های انسان‌نما و انبارگردان بتوانند با مهارت دست انسان برابری کنند، به مقیاس داده‌ای نیاز دارند که در حال حاضر وجود ندارد. وینیث ولموروگان، مدیر یادگیری رباتیک در Encord و از پیشکسوتان آزمایشگاه رباتیک OpenAI، می‌گوید که دستیابی به پیشرفت بزرگ مستلزم مجموعه‌داده‌ای است که حدود پنج برابر کل پیکره ویدئویی یوتیوب باشد.

متن فراوان است و استخراج آن رایگان است. اما داده‌های فیزیکی باید تولید شوند. آموزش تنها از طریق ویدئو اغلب فاقد دقت لازم برای دست‌کاری‌های پیچیده است. از این رو، صنعت از اصلاح معماری مدل‌ها به سمت حل مشکل بسیار دشوارترِ یعنی تولید داده‌های فیزیکی باکیفیت و برچسب‌گذاری شده، تغییر مسیر داده است.

فراتر از ویدئو: استفاده از امواج مغزی و سیگنال‌های عضلانی

استارتاپ‌هایی مانند Encord در حال آزمایش روش‌های جدید داده‌ای هستند تا بافت و زمینه عمیق‌تری را به ربات‌ها ارائه دهند. در یک پروژه آزمایشی با استارتاپ علوم اعصاب آلمانی Zander Labs، شرکت Encord اپراتورها را به هدست‌های امواج مغزی مجهز می‌کند. محققان امیدوارند با اندازه‌گیری فعالیت‌های عصبی، بتوانند قصد، خطا و غافلگیری را استنباط کنند.

لوکاس گرهکه، دانشمند علوم اعصاب در Zander، می‌گوید ردیابی فعالیت مغزی به سازندگان مدل اجازه می‌دهد دقیقاً بدانند چه زمانی یک ربات باید قدرتمندترین مدل‌های محاسباتی خود را برای انجام یک کار دشوار به کار بگیرد.

Encord همچنین موارد زیر را بررسی می‌کند:

  • الکترومیوگرافی (EMG): حسگرهایی که به ساعد بسته می‌شوند، سیگنال‌های الکتریکی عضلات را ثبت کرده و یک نقشه سه‌بعدی از حرکات دست ایجاد می‌کنند که دوربین‌های نصب‌شده روی سر اغلب قادر به ثبت آن‌ها نیستند.
  • سیستم‌های پیشرو-پیرو (Leader-Follower Rigs): بازوهای رباتیک جفت‌شده‌ای که یکی از آن‌ها از یک اپراتور انسانی تقلید می‌کند و اقدامات دقیق مانند ریختن مایعات یا چیدن تراشه‌های پوکر را ثبت می‌نماید.
  • برچسب‌گذاری متراکم (Dense Annotation): برچسب‌هایی مانند «دست راست پیچ را سفت می‌کند». ولموروگان تخمین می‌زند که این برچسب‌گذاری متراکم، ۱۰۰ برابر ارزشمندتر از ویدئوهای خامِ دوربینِ روی سر (ego video) برای آموزش وظایف خاص است.

واقعیت اقتصادی هوش مصنوعی فیزیکی

گذار از هوش مصنوعیِ دیجیتال‌محور به هوش مصنوعی فیزیکی، اقتصاد یادگیری ماشین را دگرگون می‌کند. آزمایشگاه‌های LLM مدل‌ها را با هزینه نهایی نزدیک به صفر و از طریق استخراج از وب ساختند. اما تولید داده‌های آموزشی رباتیک مستلزم سخت‌افزار، اپراتورهای انسانی و برچسب‌گذاری بسیار دقیق است. هدف Encord این است که داده‌های باکیفیت را ۲۰ برابر مقرون‌به‌صرفه‌تر از ارزش تحویلی آن‌ها تولید کند، با این حال حتی این میزان نیز برای ناوگان‌های بزرگ رباتیک به پروژه‌های چند میلیون دلاری تبدیل می‌شود.

شرکت‌هایی که اولین مجموعه‌داده‌های عظیم و غنی از نظر برچسب‌گذاری را تولید کنند، بر حوزه دست‌کاری خودکار (autonomous manipulation) — از اتصال کابل‌های اترنت گرفته تا برداشتن و بسته‌بندی کالاها — تسلط خواهند یافت. شرکت‌هایی که به خطوط تولید مبتنی بر ویدئو متوقف شوند، با خطر عقب ماندن از رقبا روبرو هستند؛ رقبانی که سیگنال‌های غنی‌تری را از بدن و مغز انسان استخراج می‌کنند.

نکات کلیدی

  • تولید داده در مقابل جمع‌آوری داده: برخلاف LLMها که داده‌های موجود در اینترنت را استخراج می‌کنند، هوش مصنوعی فیزیکی نیازمند تولید دستی و پرهزینه مجموعه‌داده‌های با دقت بالا است.
  • روش‌های عصبی: افزودن امواج مغزی و EMG به ربات‌ها اجازه می‌دهد تا قصد انسان، خطا و حرکات سه‌بعدی دست را بسیار مؤثرتر از ویدئو به تنهایی درک کنند.
  • چالش مقیاس: مدل‌های رباتیک به مجموعه‌داده‌ای بسیار بزرگ‌تر از کل آرشیو یوتیوب نیاز دارند؛ تولید داده اکنون مرز اصلی تجارت در این حوزه است.

Encord یک پروژه آزمایشی را با استارتاپ علوم اعصاب آلمانی Zander Labs آغاز کرده است که اپراتورها را به هدست‌های امواج مغزی و حسگرهای EMG ساعد مجهز می‌کند تا داده‌های آموزشی با دقت بالا برای هوش مصنوعی فیزیکی جمع‌آوری کند. هدف این همکاری تولید مجموعه‌داده‌ای است که به اندازه پنج برابر کل حجم ویدئوهای یوتیوب باشد؛ مقیاسی که محققان می‌گویند برای رسیدن ربات‌ها به مهارت دست در سطح انسان ضروری است و می‌تواند نحوه یادگیری رباتیک را بازتعریف کند.

چرا داده‌های رباتیک یک گلوگاه هستند

مدل‌های زبانی بزرگ با استخراج از وب آزاد رشد کردند؛ مواد اولیه فراوان و ارزان بود. در مقابل، هوش مصنوعی فیزیکی به داده‌هایی نیاز دارد که باید تولید شوند. هر گرفتن، چرخاندن یا ریختن باید ثبت، برچسب‌گذاری و به نیروها و نیاتی که باعث آن شده‌اند، مرتبط شود. ویدئوهای معمولی اغلب فاقد نشانه‌های ظریفی هستند که برای دست‌کاری‌های پیچیده لازم است، و همین امر شکافی را بین مدل‌های امروزی و نیازهای کارخانه‌ها، انبارها و خانه‌ها ایجاد می‌کند.

وینیث ولموروگان، مدیر یادگیری رباتیک در Encord و از پیشکسوتان آزمایشگاه رباتیک OpenAI، می‌گوید این حوزه تا زمانی که مجموعه‌داده‌ای تقریباً پنج برابر بزرگ‌تر از پیکره ویدئویی یوتیوب وجود نیاید، پیشرفت نخواهد کرد. مشکل دیگر معماری مدل نیست؛ بلکه چگونگی تولید داده‌هاست.

Adding brain waves and muscle signals

The Encord-Zander pilot tries to fill that gap by adding physiological signals to the visual record. Operators wear headsets that read electroencephalography (EEG) – the brain’s electrical activity – while EMG sensors on the forearm capture muscle impulses. The goal is to infer mental states such as intent, surprise or error, and to translate raw muscle activity into a three-dimensional map of hand motion that video alone cannot capture.

Lucas Gehrke, a neuroscientist at Zander, explains that knowing when a human anticipates a difficult sub-task lets a robot allocate its most powerful computational models at the right moment.

Beyond neuro-data, Encord tests a handful of complementary techniques:

  • Electromyography (EMG): Sensors on the forearm produce a live read-out of muscle activation, enabling a precise reconstruction of finger trajectories that head-mounted cameras often miss.
  • Leader-follower rigs: A pair of robotic arms work in tandem, one mirroring a human operator’s motions. This captures delicate tasks—pouring liquids, stacking chips—where millimetre-scale errors matter.
  • Dense annotation: Instead of labeling only high-level actions, Velmurugan’s team attaches fine-grained descriptors such as “right hand tightens bolt.” He estimates this detail is about 100 × more valuable for training a specific manipulation skill than raw ego-centric video.

The economics of data manufacturing

Physical AI changes the financial calculus of machine learning. LLM labs built models at near-zero marginal cost because the internet supplies endless text. Producing robot training data, however, requires hardware, human operators and painstaking annotation. Encord’s internal target is to make high-quality data 20 × more cost-effective than the value it delivers to customers, but even that aggressive efficiency still translates into multi-million-dollar projects for large-scale robot fleets.

The stakes are clear: companies that can generate massive, richly annotated datasets first will dominate the emerging market for autonomous manipulation—whether that means plugging in Ethernet cables on a data-center floor or picking and packing items in a distribution centre. Those that continue to rely on video-only pipelines risk falling behind as competitors extract richer signals from the human body and brain.

Counter-points and open questions

Not everyone is convinced that neuro-signals are the missing piece. Critics argue that the added hardware complexity could outweigh the benefits, especially when video plus force-torque sensors already deliver decent performance for many industrial tasks. Scalability is another concern: outfitting thousands of operators with EEG headsets and EMG rigs may prove prohibitive for smaller manufacturers.

The data-generation pipeline remains labor-intensive. Even with leader-follower rigs, capturing the breadth of tasks needed for a truly general robot will demand a sustained, coordinated effort across multiple labs and factories. The market will have to decide whether the incremental performance gains justify the upfront investment.

What to watch next

  • Data volume milestones: Encord’s claim of a dataset five times the size of YouTube will be a concrete benchmark. When disclosed, other players will have a clear target to match or exceed.
  • Hardware adoption rates: The speed at which EEG and EMG devices become standard in data-collection rigs will indicate whether the approach scales beyond experimental pilots.
  • Cost metrics: If Encord can demonstrably deliver the promised 20-fold cost advantage, it could spur a wave of new entrants focused on “data manufacturing” rather than model design.
  • Performance gaps