Xiaomi-Robotics-1 ने सिद्ध केले की रोबोटिक्समध्ये मॉडेलच्या आकारापेक्षा डेटाचे प्रमाण अधिक प्रभावी ठरते
Xiaomi ने Xiaomi-Robotics-1 सादर केले आहे, जे एक क्रांतिकारी फाऊंडेशन मॉडेल आहे. हे मॉडेल रोबोटिक ट्रेनिंगचे स्वरूप बदलत असून, आता लक्ष केवळ कॉम्प्युट पॉवर (compute power) वाढवण्याऐवजी मोठ्या प्रमाणावर डेटा स्केलिंगवर (data scaling) केंद्रित करत आहे. डेटा संकलनाच्या एका अद्वितीय पद्धतीचा वापर करून, हे मॉडेल अनोळखी वातावरण आणि जटिल हाताळणीच्या (manipulation) कामांमध्ये अभूतपूर्व अनुकूलता दर्शवते.
हँडहेल्ड ग्रिपर्सद्वारे डेटा बॉटलनेक (Data Bottleneck) दूर करणे
रोबोटिक्समधील मुख्य आव्हान नेहमीच "डेटा बॉटलनेक" (data bottleneck) राहिले आहे—म्हणजेच महागड्या आणि स्थिर रोबोटिक हातांशिवाय मोठ्या प्रमाणात उच्च-गुणवत्तेचा इंटरअॅक्शन डेटा गोळा करणे कठीण असते. Xiaomi ने कॅमेरा असलेल्या पोर्टेबल, हँडहेल्ड ग्रिपर्सचा (handheld grippers) वापर करून ही अडचण दूर केली.
रोबोट्सना प्रोग्राम करण्याऐवजी, मानवी ऑपरेटरनी हे हँडहेल्ड डिव्हाइसेस वापरून स्वयंपाकघर, कार्यालये आणि कारखाने यांसह १,७०० हून अधिक विविध वातावरणांमधील हाताळणीच्या (manipulation) कृती रेकॉर्ड केल्या. या पद्धतीमुळे तब्बल १,००,००० तासांचे मोशन रेकॉर्डिंग उपलब्ध झाले. लेबलिंगची समस्या सोडवण्यासाठी, Xiaomi ने प्रत्येक मोशन सेगमेंटसाठी स्वयंचलितपणे मजकूर वर्णन (text descriptions) तयार करण्यासाठी एका AI मॉडेलचा वापर केला, ज्यामुळे संपूर्ण डेटासेटचे लेबलिंग केवळ दोन आठवड्यांत पूर्ण झाले.
स्केलिंग लॉ (Scaling Law): कॉम्प्युटपेक्षा डेटाला महत्त्व
Xiaomi-Robotics-1 च्या संशोधनातील मुख्य तांत्रिक निष्कर्ष असा आहे की, केवळ मॉडेलचा आकार किंवा कॉम्प्युट वाढवण्यापेक्षा अधिक ट्रेनिंग डेटा दिल्यास कामगिरीमध्ये लक्षणीय सुधारणा होते. जरी मोठ्या मॉडेल्समुळे प्रेडिक्शन एरर्स (prediction errors) कमी होत असले, तरी ट्रेनिंग डेटाचे प्रमाण वाढल्यामुळे अनोळखी वातावरणात रोबोटचा यश दर (success rate) २५% वरून थेट ७५% पर्यंत वाढला.
हे कॉम्प्युटर व्हिजनमधील (computer vision) कलानुसार आहे, जिथे पॅरामीटरची संख्या वाढवण्यापेक्षा डेटा वाढवल्यास अधिक फायदा होतो. Xiaomi साठी, याचा अर्थ असा आहे की जनरल पर्पज रोबोट AI (General Purpose Robot AI) कडे जाण्याचा मार्ग केवळ मोठे न्यूरल नेटवर्क्स (neural networks) तयार करण्याऐवजी डेटासेटची विविधता आणि व्याप्ती वाढवण्यात आहे.
अतुलनीय अनुकूलता आणि बेंचमार्क कामगिरी
Xiaomi-Robotics-1 हे तोंडी किंवा लिखित आदेशांचे पालन करण्यासाठी आणि किमान फाईन-ट्यूनिंगसह (fine-tuning) नवीन कामांशी जुळवून घेण्यासाठी डिझाइन केलेले आहे. चाचणी दरम्यान, या मॉडेलला कपडे लोड करणे, प्रिंटरमध्ये कागद टाकणे आणि सूटकेस पॅक करणे यांसारखी जटिल कामे देण्यात आली होती.
निकाल स्पष्ट होते:
- जलद अनुकूलन (Rapid Adaptation): १० तासांपेक्षा कमी विशिष्ट ट्रेनिंगसह, मॉडेलने ७५% यश दर गाठला, जो स्पर्धक Physical Intelligence च्या केवळ ४०% कामगिरीपेक्षा कितीतरी पटीने जास्त आहे.
- बेंचमार्कमधील वर्चस्व: हे मॉडेल RoboCasa365 लीडरबोर्डवर मोठ्या फरकाने आघाडीवर आहे, विशेषतः न पाहिलेल्या (unseen) मिश्रित कामांमध्ये.
- RoboDojo कामगिरी: RoboDojo बेंचमार्कवर Xiaomi-Robotics-1 ने दुसऱ्या क्रमांकाच्या मॉडेलपेक्षा सुमारे ५८% जास्त गुण मिळवले.
कागदासारख्या मऊ आणि लवचिक (deformable) पदार्थांना हाताळण्यातही या मॉडेलने विशेष कौशल्य दाखवले—जे पारंपारिकपणे रिजिड रोबोटिक सिस्टमसाठी (rigid robotic systems) एक कठीण क्षेत्र राहिले आहे.
रोबोटिक्स उद्योगासाठी एक नवीन दिशा
Xiaomi चा दृष्टिकोन इतर उद्योग क्षेत्रातील दिग्गजांच्या मार्गापेक्षा वेगळा आहे. जिथे Nvidia सिंथेटिक डेटा जनरेशनद्वारे रोबोटिक्स डेटाच्या समस्येला कॉम्प्युटच्या समस्येत बदलण्याचा प्रयत्न करत आहे, आणि BAAI चे Orca मॉडेल अनलेबल व्हिडिओमधून शिकण्याचा प्रयत्न करत आहे, तिथे Xiaomi स्वयंचलित, मोठ्या प्रमाणावरील लेबल केलेल्या मोशन डेटावर अधिक भर देत आहे.
Xiaomi जेव्हा हे मॉडेल आणि कोड GitHub आणि Hugging Face वर रिलीज करण्याची तयारी करत आहे, तेव्हा संपूर्ण उद्योग याकडे बारकाईने पाहत आहे. या विकासामुळे असे सूचित होते की, रोबोटिक्सचे पुढील क्षेत्र केवळ सर्वात शक्तिशाली चिप्स असलेल्यांनी नाही, तर सर्वात वैविध्यपूर्ण आणि चांगल्या प्रकारे लेबल केलेल्या मोशन डेटासेट असलेल्यांनी जिंकले जाईल.
मुख्य निष्कर्ष
- डेटा-केंद्रित स्केलिंग (Data-Centric Scaling): मॉडेलचा आकार किंवा कॉम्प्युट वाढवण्यापेक्षा ट्रेनिंग डेटाचे प्रमाण वाढवणे रोबोटिक यश दरासाठी अधिक प्रभावी ठरले.
- नाविन्यपूर्ण संकलन: हँडहेल्ड ग्रिपर्समुळे Xiaomi ला समर्पित रोबोट्सशिवाय १,७०० वातावरणांमधून १,००,००० तासांचा मोशन डेटा गोळा करणे शक्य झाले.
- उच्च सामान्यीकरण (High Generalization): हे मॉडेल १० तासांपेक्षा कमी अतिरिक्त ट्रेनिंगसह नवीन कामांवर ७५% यश दर गाठू शकते.
