फिजिकल AI च्या क्षेत्रात एक मोठी अडचण येत आहे: आपल्याकडे उच्च-गुणवत्तेचा (high-fidelity), वास्तव जगातील प्रशिक्षण डेटा उपलब्ध नाही. Large Language Models इंटरनेटवरील मजकूर गोळा करून (scraping) विकसित झाले; परंतु रोबोटिक्ससाठी त्याहूनही खर्चिक दृष्टिकोनाची गरज आहे.

रोबोटिक्समधील डेटाची कमतरता

ह्युमनॉइड (humanoid) आणि वेअरहाऊस रोबोट्सना मानवी चपळतेशी (dexterity) स्पर्धा करण्यासाठी अशा डेटा स्केलची गरज आहे, जे सध्या उपलब्ध नाही. Encord चे रोबोट लर्निंग प्रमुख आणि OpenAI च्या रोबोट लॅबमधील अनुभवी व्यक्ती विनीत वेलमुरुगन यांच्या मते, या क्षेत्रात मोठी क्रांती घडवून आणण्यासाठी YouTube च्या संपूर्ण व्हिडिओ संग्रहापेक्षा सुमारे पाचपट मोठ्या डेटासेटची आवश्यकता आहे.

मजकूर (Text) मुबलक प्रमाणात उपलब्ध आहे आणि तो सहजपणे गोळा करता येतो. मात्र, फिजिकल डेटा तयार करावा लागतो (manufactured). केवळ व्हिडिओवरून प्रशिक्षण दिल्यास गुंतागुंतीच्या हालचालींसाठी (complex manipulation) आवश्यक असलेली अचूकता मिळत नाही. त्यामुळे, उद्योग आता मॉडेल आर्किटेक्चरमध्ये बदल करण्याऐवजी, उच्च-गुणवत्तेचा आणि अ‍ॅनोटेटेड (annotated) फिजिकल डेटा तयार करण्याच्या कठीण समस्येवर लक्ष केंद्रित करत आहे.

व्हिडिओच्या पलीकडे: मेंदूच्या लहरी आणि स्नायूंच्या संकेतांचा वापर

रोबोट्सना अधिक सखोल संदर्भ देण्यासाठी Encord सारखे स्टार्टअप्स नवीन डेटा मोडॅलिटीज (modalities) तपासत आहेत. जर्मन न्यूरोसायन्स स्टार्टअप Zander Labs सोबतच्या एका प्रायोगिक प्रकल्पात, Encord ऑपरेटर्सना ब्रेन-वेव्ह हेडसेट्स पुरवत आहे. मज्जासंस्थेच्या (neural activity) हालचाली मोजून, संशोधकांना हेतू (intent), चूक (error) आणि आश्चर्य (surprise) यांचा अंदाज लावण्याची आशा आहे.

Zander मधील न्यूरोसायंटिस्ट लुकास गेरके म्हणतात की, मेंदूच्या हालचालींचा मागोवा घेतल्यामुळे मॉडेल बिल्डर्सना हे अचूकपणे समजते की, एखाद्या कठीण कार्यासाठी रोबोटने त्याचे सर्वात शक्तिशाली कॉम्प्युटेशनल मॉडेल्स कधी वापरावे.

Encord खालील गोष्टींचाही शोध घेत आहे:

  • Electromyography (EMG): हाताच्या मनगटावर लावलेले सेन्सर्स स्नायूतील विद्युत संकेत टिपतात, ज्यामुळे हाताच्या हालचालींचा असा 3-D नकाशा तयार होतो जो डोक्यावर लावलेल्या कॅमेऱ्यांकडून अनेकदा सुटतो.
  • Leader-Follower Rigs: जोडलेले रोबोटिक हात, जिथे एक हात मानवी ऑपरेटरची नक्कल करतो आणि द्रव पदार्थ ओतणे किंवा पोकर चिप्स रचणे यांसारख्या अचूक हालचाली टिपतो.
  • Dense Annotation: "उजव्या हाताने बोल्ट घट्ट केला" यांसारखी लेबल्स. वेलमुरुगन यांच्या मते, विशिष्ट कार्यांसाठी प्रशिक्षण देण्यासाठी हा 'डेंस अ‍ॅनोटेशन' (dense annotation) कच्च्या 'एगो व्हिडिओ' (ego video) पेक्षा १०० पट अधिक मौल्यवान आहे.

फिजिकल AI चे आर्थिक वास्तव

डिजिटल-फर्स्ट AI कडून फिजिकल AI कडे वळल्यामुळे मशीन लर्निंगचे अर्थशास्त्र पूर्णपणे बदलले आहे. LLM लॅब्सनी वेबवरून डेटा घेऊन जवळजवळ शून्य अतिरिक्त खर्चात (near-zero marginal cost) मॉडेल्स तयार केली. मात्र, रोबोट ट्रेनिंग डेटा तयार करण्यासाठी हार्डवेअर, मानवी ऑपरेटर्स आणि अत्यंत सूक्ष्म अ‍ॅनोटेशनची आवश्यकता असते. Encord चा उद्देश उच्च-गुणवत्तेचा डेटा त्याच्या मूल्यापेक्षा २० पट अधिक किफायतशीर बनवणे हा आहे, तरीही मोठ्या रोबोटिक ताफ्यांसाठी (robot fleets) हे प्रकल्प करोडो डॉलर्सचे असतात.

ज्या कंपन्या प्रथम प्रचंड आणि समृद्ध अ‍ॅनोटेटेड डेटासेट तयार करतील, त्या ऑटोनॉमस मॅनिप्युलेशनमध्ये (autonomous manipulation) वर्चस्व गाजवतील—ज्यात इथरनेट केबल्स लावण्यापासून ते वस्तू उचलणे आणि पॅक करणे यांसारख्या गोष्टींचा समावेश आहे. जे केवळ व्हिडिओवर अवलंबून राहतील, त्यांना स्पर्धकांकडून मानवी शरीर आणि मेंदूतील अधिक समृद्ध संकेत मिळवल्यामुळे मागे पडण्याचा धोका आहे.

मुख्य निष्कर्ष

  • डेटा मॅन्युफॅक्चरिंग विरुद्ध कलेक्शन: इंटरनेटवरील उपलब्ध डेटा गोळा करणाऱ्या LLMs च्या उलट, फिजिकल AI साठी उच्च-गुणवत्तेच्या डेटासेटचे महागडे आणि मॅन्युअल मॅन्युफॅक्चरिंग आवश्यक आहे.
  • न्यूरोलॉजिकल मोडॅलिटीज: मेंदूच्या लहरी आणि EMG जोडल्यामुळे रोबोट्सना केवळ व्हिडिओच्या तुलनेत मानवी हेतू, चुका आणि हाताच्या 3-D हालचाली अधिक प्रभावीपणे समजण्यास मदत होते.
  • स्केलची आव्हाने: रोबोटिक्स मॉडेल्सना संपूर्ण YouTube आर्काइव्हपेक्षाही मोठ्या डेटासेटची गरज आहे; आता डेटा जनरेशन हे व्यवसायातील मुख्य क्षेत्र बनले आहे.

Encord ने जर्मन न्यूरोसायन्स स्टार्टअप Zander Labs सोबत एक प्रायोगिक प्रकल्प सुरू केला आहे, ज्यामध्ये ऑपरेटर्सना ब्रेन-वेव्ह हेडसेट्स आणि हाताच्या मनगटावर EMG सेन्सर्स दिले जातात, जेणेकरून फिजिकल AI साठी उच्च-गुणवत्तेचा ट्रेनिंग डेटा टिपता येईल. या भागीदारीचा उद्देश YouTube च्या एकूण व्हिडिओ प्रमाणापेक्षा पाचपट मोठा डेटासेट तयार करणे हा आहे—संशोधकांच्या मते, रोबोट्सना मानवी पातळीवरील चपळता प्राप्त करण्यासाठी या स्केलची आवश्यकता आहे आणि यामुळे रोबोटिक्स शिकण्याची पद्धत बदलू शकते.

रोबोटिक्स डेटा अडथळा का आहे?

Large language models ओपन वेबवरून डेटा गोळा करून विकसित झाले; त्यासाठी लागणारा कच्चा माल मुबलक आणि स्वस्त होता. याउलट, फिजिकल AI ला असा डेटा हवा असतो जो तयार (manufactured) करावा लागतो. प्रत्येक पकड (grasp), फिरवणे (twist) किंवा ओतणे (pour) या क्रिया रेकॉर्ड, अ‍ॅनोटेट आणि त्यामागील बल (forces) आणि हेतूशी जोडणे आवश्यक आहे. सामान्य व्हिडिओमध्ये गुंतागुंतीच्या हालचालींसाठी आवश्यक असलेले सूक्ष्म संकेत अनेकदा सुटतात, ज्यामुळे आजची मॉडेल्स आणि कारखाने, वेअरहाऊस आणि घरांच्या गरजा यामध्ये तफावत निर्माण होते.

Encord चे रोबोट लर्निंग प्रमुख आणि माजी OpenAI रोबोट-लॅब अनुभवी विनीत वेलमुरुगन म्हणतात की, जोपर्यंत YouTube च्या व्हिडिओ संग्रहापेक्षा सुमारे पाचपट मोठा डेटासेट उपलब्ध होत नाही, तोपर्यंत हे क्षेत्र पुढे जाणार नाही. समस्या आता मॉडेल आर्किटेक्चरची राहिलेली नाही; तर ती डेटा कसा तयार (manufacture) करायचा याची आहे.

मेंदूच्या लहरी आणि स्नायूंचे संकेत जोडणे

Encord-Zander पायलट व्हिज्युअल रेकॉर्डमध्ये शारीरिक (physiological) संकेत जोडून ती तफावत भरून काढण्याचा प्रयत्न करत आहे. ऑपरेटर्स हेडसेट वापरतात जे इलेक्ट्रोएन्सेफॅलोग्राफी (EEG) – म्हणजेच मेंदूची विद्युत क्रिया – वाचतात, तर हाताच्या अग्रभागावरील (forearm) EMG सेन्सर्स स्नायूंचे आवेग (impulses) टिपतात. याचा उद्देश हेतू, आश्चर्य किंवा चूक यांसारख्या मानसिक स्थितींचा अंदाज घेणे आणि कच्च्या स्नायूंच्या हालचालींचे हाताच्या हालचालींच्या त्रिमितीय (3D) नकाशात रूपांतर करणे हा आहे, जे केवळ व्हिडिओद्वारे शक्य नाही.

Zander मधील न्यूरोसायंटिस्ट लुकास गेर्के स्पष्ट करतात की, एखादा माणूस कठीण उप-कार्य (sub-task) कधी अपेक्षित करतो हे समजल्यामुळे रोबोटला योग्य वेळी त्याचे सर्वात शक्तिशाली कम्प्युटेशनल मॉडेल्स वापरता येतात.

न्यूरो-डेटाच्या पलीकडे, Encord काही पूरक तंत्रांची चाचणी घेत आहे:

  • Electromyography (EMG): हाताच्या अग्रभागावरील सेन्सर्स स्नायूंच्या सक्रियतेचा थेट (live) डेटा देतात, ज्यामुळे बोटांच्या हालचालींचा (trajectories) अचूक नकाशा तयार करणे शक्य होते, जे डोक्यावर लावलेल्या कॅमेऱ्यांकडून अनेकदा सुटते.
  • Leader-follower rigs: रोबोटिक हातांची एक जोडी एकमेकांच्या समन्वयाने काम करते, ज्यामध्ये एक हात मानवी ऑपरेटरच्या हालचालींची प्रतिकृती तयार करतो. यामुळे द्रव पदार्थ ओतणे, चिप्स रचणे यांसारखी नाजूक कामे टिपली जातात, जिथे मिलीमीटर-स्तरीय चुका देखील महत्त्वाच्या ठरतात.
  • Dense annotation: केवळ उच्च-स्तरीय कृतींना लेबल देण्याऐवजी, वेलमुरुगनची टीम "उजव्या हाताने बोल्ट घट्ट करणे" यांसारखे सूक्ष्म तपशील (fine-grained descriptors) जोडते. त्यांच्या मते, विशिष्ट हाताळणी कौशल्य (manipulation skill) प्रशिक्षित करण्यासाठी कच्च्या 'इगो-सेंट्रिक' (ego-centric) व्हिडिओपेक्षा हा तपशील सुमारे १०० पट अधिक मौल्यवान आहे.

डेटा मॅन्युफॅक्चरिंगचे अर्थशास्त्र

फिजिकल AI मशीन लर्निंगचे आर्थिक गणित बदलत आहे. इंटरनेटमुळे अमर्याद मजकूर उपलब्ध असल्याने LLM लॅब्सनी जवळजवळ शून्य सीमांत खर्चात (near-zero marginal cost) मॉडेल्स तयार केले. मात्र, रोबोट ट्रेनिंग डेटा तयार करण्यासाठी हार्डवेअर, मानवी ऑपरेटर्स आणि अत्यंत बारकाईने अ‍ॅनोटेशन (annotation) आवश्यक असते. ग्राहकांना मिळणाऱ्या मूल्याच्या तुलनेत उच्च-गुणवत्तेचा डेटा २० पट अधिक किफायतशीर बनवणे हे Encord चे अंतर्गत उद्दिष्ट आहे, परंतु ही आक्रमक कार्यक्षमता असूनही मोठ्या प्रमाणावरील रोबोट ताफ्यांसाठी (robot fleets) हे प्रकल्प करोडो डॉलर्सचे ठरतात.

यात जोखीम स्पष्ट आहे: ज्या कंपन्या प्रथम प्रचंड आणि समृद्ध अ‍ॅनोटेटेड डेटासेट तयार करू शकतील, त्या स्वायत्त हाताळणीच्या (autonomous manipulation) उदयोन्मुख बाजारपेठेवर वर्चस्व गाजवतील—मग ते डेटा-सेंटरच्या मजल्यावरील इथरनेट केबल्स जोडणे असो किंवा वितरण केंद्रात वस्तू निवडणे आणि पॅक करणे असो. जे केवळ व्हिडिओ-आधारित पाइपलाइनवर अवलंबून राहतील, त्यांना स्पर्धकांनी मानवी शरीर आणि मेंदूपासून अधिक समृद्ध संकेत मिळवल्यामुळे मागे पडण्याचा धोका आहे.

प्रतिवाद आणि उघड्या प्रश्ना

न्यूरो-सिग्नल्स हेच गहाळ असलेले घटक आहेत, यावर सर्वजण सहमत नाहीत. टीकाकारांचे म्हणणे आहे की, हार्डवेअरची वाढलेली गुंतागुंत फायद्यांपेक्षा जास्त असू शकते, विशेषतः जेव्हा व्हिडिओ आणि फोर्स-टॉर्क सेन्सर्स अनेक औद्योगिक कामांसाठी आधीच समाधानकारक कामगिरी करतात. स्केलेबिलिटी (Scalability) ही दुसरी चिंता आहे: हजारो ऑपरेटर्सना EEG हेडसेट आणि EMG रिग्सने सुसज्ज करणे लहान उत्पादकांसाठी खर्चिक ठरू शकते.

डेटा-जनरेशन पाइपलाइन अजूनही श्रम-केंद्रित आहे. लीडर-फॉलोअर रिग्स असूनही, खऱ्या अर्थाने सर्वसमावेशक रोबोटसाठी आवश्यक असलेल्या कामांची व्याप्ती टिपण्यासाठी अनेक लॅब्स आणि कारखान्यांमध्ये सातत्यपूर्ण आणि समन्वित प्रयत्नांची आवश्यकता असेल. वाढलेली कामगिरी या सुरुवातीच्या गुंतवणुकीला оправवते का, याचा निर्णय बाजारपेठेला घ्यावा लागेल.

पुढे काय पाहावे

  • डेटा व्हॉल्यूमचे टप्पे (Milestones): YouTube पेक्षा पाचपट मोठ्या डेटासेटचा Encord चा दावा हा एक ठोस बेंचमार्क असेल. जेव्हा हा डेटा समोर येईल, तेव्हा इतर खेळाडूंना तो बरोबरी करण्यासाठी किंवा मागे टाकण्यासाठी एक स्पष्ट लक्ष्य मिळेल.
  • हार्डवेअर अवलंबण्याचे दर (Adoption rates): डेटा-संकलन रिग्समध्ये EEG आणि EMG उपकरणे किती वेगाने प्रमाणित होतील, यावरून हा दृष्टिकोन प्रायोगिक पायलट प्रकल्पांच्या पलीकडे विस्तारू शकेल की नाही, हे समजेल.
  • खर्च मेट्रिक्स (Cost metrics): जर Encord ने वचन दिल्याप्रमाणे २० पटीचा खर्च फायदा सिद्ध करून दाखवला, तर यामुळे मॉडेल डिझाइनऐवजी "डेटा मॅन्युफॅक्चरिंग" वर लक्ष केंद्रित करणाऱ्या नवीन कंपन्यांची लाट येऊ शकते.
  • कामगिरीतील तफावत (Performance gaps)