Xiaomi-Robotics-1 ने साबित किया कि रोबोटिक्स में डेटा की मात्रा मॉडल के आकार से अधिक प्रभावी है
Xiaomi ने Xiaomi-Robotics-1 का अनावरण किया है, जो एक क्रांतिकारी फाउंडेशन मॉडल है। यह रोबोटिक ट्रेनिंग के प्रतिमान (paradigm) को कंप्यूटिंग पावर बढ़ाने के बजाय बड़े पैमाने पर डेटा स्केलिंग की ओर ले जाता है। डेटा संग्रह की एक अनूठी विधि का लाभ उठाकर, यह मॉडल अपरिचित वातावरण और जटिल मैनिपुलेशन कार्यों में अभूतपूर्व अनुकूलन क्षमता प्रदर्शित करता है।
हैंडहेल्ड ग्रिपर्स के साथ डेटा की बाधा को तोड़ना
रोबोटिक्स में प्राथमिक चुनौती हमेशा "डेटा बॉटलनेक" (data bottleneck) रही है—यानी महंगे और स्थिर रोबोटिक आर्म्स के बिना बड़ी मात्रा में उच्च गुणवत्ता वाला इंटरैक्शन डेटा एकत्र करने की कठिनाई। Xiaomi ने कैमरों से लैस पोर्टेबल, हैंडहेल्ड ग्रिपर्स का उपयोग करके इस समस्या का समाधान किया।
रोबोट्स को प्रोग्राम करने के बजाय, मानव ऑपरेटरों ने रसोई, कार्यालय और कारखानों सहित 1,700 से अधिक विविध वातावरणों में मैनिपुलेशन कार्यों को रिकॉर्ड करने के लिए इन हैंडहेल्ड उपकरणों का उपयोग किया। इस दृष्टिकोण से 1,00,000 घंटों की आश्चर्यजनक मोशन रिकॉर्डिंग प्राप्त हुई। लेबलिंग की समस्या को हल करने के लिए, Xiaomi ने प्रत्येक मोशन सेगमेंट के लिए स्वचालित रूप से टेक्स्ट विवरण उत्पन्न करने के लिए एक AI मॉडल का उपयोग किया, जिससे केवल दो सप्ताह में पूरे डेटासेट की लेबलिंग पूरी हो गई।
स्केलिंग लॉ: कंप्यूट से अधिक डेटा का महत्व
Xiaomi-Robotics-1 शोध से प्राप्त मुख्य तकनीकी अंतर्दृष्टि यह है कि केवल मॉडल का आकार या कंप्यूट बढ़ाने की तुलना में अधिक ट्रेनिंग डेटा से प्रदर्शन में काफी अधिक सुधार होता है। हालांकि बड़े मॉडल प्रेडिक्शन एरर (prediction errors) को कम करते हैं, लेकिन जैसे-जैसे ट्रेनिंग डेटा की मात्रा बढ़ी, अपरिचित वातावरण में रोबोट की सफलता दर 25% से बढ़कर 75% हो गई।
यह कंप्यूटर विजन में देखे गए रुझानों के समान है, जहाँ पैरामीटर काउंट बढ़ाने की तुलना में डेटा जोड़ना अधिक मूल्य प्रदान करता है। Xiaomi के लिए, इसका अर्थ है कि जनरल पर्पस रोबोट AI का मार्ग केवल बड़े न्यूरल नेटवर्क बनाने के बजाय डेटासेट की विविधता और पैमाने में निहित है।
बेजोड़ अनुकूलन क्षमता और बेंचमार्क प्रदर्शन
Xiaomi-Robotics-1 को बोले गए या लिखे गए कमांड का पालन करने और न्यूनतम फाइन-ट्यूनिंग के साथ नए कार्यों के अनुकूल होने के लिए डिज़ाइन किया गया है। परीक्षण में, मॉडल को कपड़े लोड करने, प्रिंटर में पेपर डालने और सूटकेस पैक करने जैसे जटिल कार्यों की जिम्मेदारी दी गई थी।
परिणाम निर्णायक थे:
- तेजी से अनुकूलन: 10 घंटे से भी कम टास्क-विशिष्ट ट्रेनिंग के साथ, मॉडल ने 75% सफलता दर हासिल की, जो प्रतिस्पर्धी Physical Intelligence (जिसने केवल 40% हासिल किया) से काफी बेहतर है।
- बेंचमार्क में दबदबा: मॉडल RoboCasa365 लीडरबोर्ड में बड़े अंतर से आगे है, विशेष रूप से अनदेखे कंपोजिट कार्यों (unseen composite tasks) पर।
- RoboDojo प्रदर्शन: Xiaomi-Robotics-1 ने RoboDojo बेंचमार्क पर रनर-अप की तुलना में लगभग 58% अधिक स्कोर किया।
मॉडल ने कागज जैसे नरम और लचीले (deformable) पदार्थों को संभालने में भी विशेष शक्ति दिखाई—जो ऐतिहासिक रूप से रिजिड रोबोटिक सिस्टम के लिए एक कठिन क्षेत्र रहा है।
रोबोटिक्स उद्योग के लिए एक नई दिशा
Xiaomi का दृष्टिकोण अन्य उद्योग दिग्गजों के साथ एक चौराहे पर खड़ा है। जहाँ Nvidia सिंथेटिक डेटा जनरेशन के माध्यम से रोबोटिक्स डेटा समस्या को कंप्यूट समस्या में बदलने का प्रयास कर रहा है, और BAAI का Orca मॉडल बिना लेबल वाले वीडियो से सीखने का प्रयास करता है, वहीं Xiaomi स्वचालित, बड़े पैमाने पर लेबल किए गए मोशन डेटा पर अधिक ध्यान केंद्रित कर रहा है।
जैसे-जैसे Xiaomi GitHub और Hugging Face पर मॉडल और कोड जारी करने की तैयारी कर रहा है, उद्योग इसे करीब से देख रहा है। यह विकास बताता है कि रोबोटिक्स की अगली सीमा उन लोगों द्वारा नहीं जीती जाएगी जिनके पास सबसे शक्तिशाली चिप्स हैं, बल्कि उन लोगों द्वारा जीती जाएगी जिनके पास सबसे विविध और अच्छी तरह से लेबल किए गए मोशन डेटासेट हैं।
मुख्य बातें
- डेटा-केंद्रित स्केलिंग: मॉडल का आकार या कंप्यूट बढ़ाने की तुलना में ट्रेनिंग डेटा की मात्रा बढ़ाना रोबोटिक सफलता दर के लिए अधिक प्रभावी साबित हुआ।
- अभिनव संग्रह: हैंडहेल्ड ग्रिपर्स ने Xiaomi को समर्पित रोबोट्स की आवश्यकता के बिना 1,700 वातावरणों में 1,00,000 घंटों का मोशन डेटा इकट्ठा करने की अनुमति दी।
- उच्च सामान्यीकरण (High Generalization): मॉडल 10 घंटे से भी कम अतिरिक्त ट्रेनिंग के साथ नए कार्यों पर 75% सफलता दर प्राप्त कर सकता है।
