Xiaomi-Robotics-1 نے ثابت کیا کہ روبوٹکس میں ڈیٹا کا حجم ماڈل کے سائز سے زیادہ بہتر کارکردگی دکھاتا ہے

Xiaomi نے Xiaomi-Robotics-1 کا انکشاف کیا ہے، جو کہ ایک انقلابی فاؤنڈیشن ماڈل ہے جو روبوٹک ٹریننگ کے تصور کو کمپیوٹ پاور بڑھانے کے بجائے ڈیٹا کے وسیع پیمانے (scaling) کی طرف منتقل کرتا ہے۔ ڈیٹا اکٹھا کرنے کے ایک منفرد طریقے کا استعمال کرتے ہوئے، یہ ماڈل غیر مانوس ماحول اور پیچیدہ مینیپولیشن (manipulation) کے کاموں میں بے مثال مطابقت کا مظاہرہ کرتا ہے۔

ہینڈ ہیلڈ گرپرز کے ذریعے ڈیٹا کی رکاوٹ (bottleneck) کو ختم کرنا

روبوٹکس میں بنیادی چیلنج ہمیشہ سے "ڈیٹا کی رکاوٹ" (data bottleneck) رہا ہے—یعنی مہنگے اور ساکن روبوٹک بازوؤں کے بغیر اعلیٰ معیار کے وسیع انٹرایکشن ڈیٹا کو اکٹھا کرنے میں دشواری۔ Xiaomi نے کیمروں سے لیس پورٹیبل، ہینڈ ہیلڈ گرپرز کا استعمال کرتے ہوئے اس مسئلے کو حل کیا۔

روبوٹس کو پروگرام کرنے کے بجائے، انسانی آپریٹرز نے ان ہینڈ ہیلڈ آلات کا استعمال کرتے ہوئے کچن، دفاتر اور فیکٹریوں سمیت 1,700 سے زیادہ متنوع ماحول میں مینیپولیشن کے کاموں کو ریکارڈ کیا۔ اس طریقے سے 100,000 گھنٹوں کی حیرت انگیز موشن ریکارڈنگز حاصل ہوئیں۔ لیبلنگ کے مسئلے کو حل کرنے کے لیے، Xiaomi نے ایک AI ماڈل کا استعمال کیا تاکہ ہر موشن سیگمنٹ کے لیے خودکار طور پر ٹیکسٹ ڈسکرپشنز تیار کی جا سکیں، جس سے پورے ڈیٹا سیٹ کی لیبلنگ محض دو ہفتوں میں مکمل ہو گئی۔

اسکیلنگ کا قانون: کمپیوٹ کے مقابلے میں ڈیٹا کی اہمیت

Xiaomi-Robotics-1 کی تحقیق سے حاصل ہونے والا بنیادی تکنیکی نکتہ یہ ہے کہ محض ماڈل کا سائز یا کمپیوٹ بڑھانے کے مقابلے میں زیادہ ٹریننگ ڈیٹا کارکردگی میں نمایاں بہتری لاتا ہے۔ اگرچہ بڑے ماڈلز پیش گوئی کی غلطیوں (prediction errors) کو کم کرتے ہیں، لیکن جیسے جیسے ٹریننگ ڈیٹا کا حجم بڑھا، غیر مانوس ماحول میں روبوٹ کی کامیابی کی شرح 25% سے بڑھ کر 75% تک پہنچ گئی۔

یہ کمپیوٹر ویژن میں دیکھے جانے والے رجحانات کی عکاسی کرتا ہے، جہاں پیرامیٹر کی تعداد بڑھانے کے مقابلے میں ڈیٹا کا اضافہ زیادہ اہمیت رکھتا ہے۔ Xiaomi کے لیے، اس کا مطلب یہ ہے کہ جنرل پرپز روبوٹ AI کا راستہ محض بڑے نیورل نیٹ ورکس بنانے کے بجائے ڈیٹا سیٹس کے تنوع اور پیمانے میں پنہاں ہے۔

بے مثال مطابقت اور بینچ مارک کارکردگی

Xiaomi-Robotics-1 کو اس طرح ڈیزائن کیا گیا ہے کہ وہ بولے گئے یا لکھے گئے احکامات پر عمل کرے اور کم سے کم فائن ٹیوننگ کے ساتھ نئے کاموں کے مطابق ڈھل جائے۔ ٹیسٹنگ کے دوران، ماڈل کو کپڑے لوڈ کرنے، پرنٹر میں کاغذ ڈالنے اور سوٹ کیس پیک کرنے جیسے پیچیدہ کام سونپے گئے۔

نتائج حتمی تھے:

  • تیز رفتار مطابقت: 10 گھنٹے سے بھی کم مخصوص ٹریننگ کے ساتھ، ماڈل نے 75% کامیابی کی شرح حاصل کی، جو کہ حریف Physical Intelligence سے کہیں بہتر ہے، جس نے صرف 40% کامیابی حاصل کی۔
  • بینچ مارک پر غلبہ: یہ ماڈل RoboCasa365 لیڈر بورڈ پر بڑے فرق سے سبقت لے رہا ہے، خاص طور پر غیر دیکھے ہوئے مرکب کاموں (composite tasks) میں۔
  • RoboDojo کارکردگی: Xiaomi-Robotics-1 نے RoboDojo بینچ مارک پر دوسرے نمبر پر آنے والے ماڈل سے تقریباً 58% زیادہ اسکور حاصل کیا۔

ماڈل نے کاغذ جیسے نرم اور لچکدار مواد کو سنبھالنے میں بھی خاص مہارت دکھائی—جو کہ تاریخی طور پر سخت روبوٹک سسٹمز کے لیے ایک مشکل شعبہ رہا ہے۔

روبوٹکس کی صنعت کے لیے ایک نئی سمت

Xiaomi کا طریقہ کار دیگر صنعتی دیو ہیکل اداروں کے مقابلے میں ایک مختلف راستے پر ہے۔ جہاں Nvidia مصنوعی ڈیٹا کی تخلیق (synthetic data generation) کے ذریعے روبوٹکس ڈیٹا کے مسئلے کو کمپیوٹ کے مسئلے میں بدلنے کی کوشش کر رہا ہے، اور BAAI کا Orca ماڈل بغیر لیبل شدہ ویڈیوز سے سیکھنے کی کوشش کر رہا ہے، وہیں Xiaomi خودکار اور بڑے پیمانے پر لیبل شدہ موشن ڈیٹا پر بھرپور توجہ دے رہا ہے۔

جیسے جیسے Xiaomi GitHub اور Hugging Face پر ماڈل اور کوڈ جاری کرنے کی تیاری کر رہا ہے، پوری صنعت اس کا گہری نظر سے مشاہدہ کر رہی ہے۔ یہ پیش رفت بتاتی ہے کہ روبوٹکس کی اگلی سرحد ان لوگوں کے ذریعے فتح نہیں کی جائے گی جن کے پاس سب سے طاقتور چپس ہوں گی، بلکہ ان کے ذریعے ہوگی جن کے پاس سب سے متنوع اور بہتر طریقے سے لیبل شدہ موشن ڈیٹا سیٹس ہوں گے۔

اہم نکات

  • ڈیٹا پر مبنی اسکیلنگ: روبوٹک کامیابی کی شرح کے لیے ماڈل کا سائز یا کمپیوٹ بڑھانے کے مقابلے میں ٹریننگ ڈیٹا کا حجم بڑھانا زیادہ مؤثر ثابت ہوا۔
  • جدید طریقہ کارِ جمع آوری: ہینڈ ہیلڈ گرپرز نے Xiaomi کو مخصوص روبوٹس کی ضرورت کے بغیر 1,700 ماحول میں 100,000 گھنٹوں کا موشن ڈیٹا جمع کرنے کی اجازت دی۔
  • اعلیٰ عمومی قابلیت (Generalization): ماڈل 10 گھنٹے سے بھی کم اضافی ٹریننگ کے ساتھ نئے کاموں پر 75% کامیابی کی شرح حاصل کر سکتا ہے۔