Xiaomi-Robotics-1 ثابت می‌کند که حجم داده‌ها در رباتیک از اندازه مدل پیشی می‌گیرد

شیائومی از Xiaomi-Robotics-1 رونمایی کرد؛ یک مدل پایه پیشگام که پارادایم آموزش رباتیک را از افزایش قدرت محاسباتی به مقیاس‌پذیری عظیم داده‌ها تغییر می‌دهد. این مدل با بهره‌گیری از یک روش منحصر‌به‌فرد جمع‌آوری داده، سازگاری بی‌سابقه‌ای را در محیط‌های ناآشنا و وظایف پیچیده دست‌ورزی (manipulation) نشان می‌دهد.

شکستن گلوگاه داده با گیره‌های دستی

چالش اصلی در رباتیک همواره «گلوگاه داده» بوده است؛ یعنی دشواریِ جمع‌آوری حجم عظیمی از داده‌های تعاملی باکیفیت بدون استفاده از بازوهای رباتیک گران‌قیمت و ثابت. شیائومی با استفاده از گیره‌های دستی قابل حمل مجهز به دوربین، این مشکل را برطرف کرد.

اپراتورهای انسانی به جای برنامه‌نویسی ربات‌ها، از این دستگاه‌های دستی برای ضبط وظایف دست‌ورزی در بیش از ۱۷۰۰ محیط متنوع، از جمله آشپزخانه‌ها، ادارات و کارخانه‌ها استفاده کردند. این رویکرد منجر به ثبت خیره‌کننده ۱۰۰,۰۰۰ ساعت ضبط حرکتی شد. برای حل مشکل برچسب‌گذاری (labeling)، شیائومی از یک مدل هوش مصنوعی برای تولید خودکار توضیحات متنی برای هر بخش حرکتی استفاده کرد و برچسب‌گذاری کل مجموعه داده را تنها در دو هفته به پایان رساند.

قانون مقیاس‌پذیری: اولویت داده بر محاسبات

بینش فنی اصلی در تحقیق Xiaomi-Robotics-1 این است که داده‌های آموزشی بیشتر، نسبت به صرفاً افزایش اندازه مدل یا قدرت محاسباتی، بهبود عملکرد بسیار بیشتری ایجاد می‌کنند. اگرچه مدل‌های بزرگ‌تر خطاهای پیش‌بینی را کاهش می‌دهند، اما با افزایش حجم داده‌های آموزشی، نرخ موفقیت ربات در محیط‌های ناآشنا از ۲۵٪ به ۷۵٪ جهش کرد.

این موضوع بازتاب‌دهنده روندهای مشاهده شده در بینایی ماشین است، جایی که افزودن داده ارزش بیشتری نسبت به افزایش تعداد پارامترها دارد. برای شیائومی، این بدان معناست که مسیر رسیدن به هوش مصنوعی رباتیک همه‌منظوره (General Purpose Robot AI) در تنوع و مقیاس مجموعه‌داده‌ها نهفته است، نه فقط در ساخت شبکه‌های عصبی بزرگ‌تر.

سازگاری بی‌نظیر و عملکرد در بنچمارک‌ها

Xiaomi-Robotics-1 برای پیروی از دستورات شفاهی یا نوشتاری و سازگاری با وظایف جدید با حداقل تنظیم دقیق (fine-tuning) طراحی شده است. در آزمایش‌ها، وظایف پیچیده‌ای مانند بارگذاری لباس‌های شستنی، وارد کردن کاغذ به چاپگر و بسته‌بندی چمدان‌ها به این مدل محول شد.

نتایج قطعی بودند:

  • سازگاری سریع: با کمتر از ۱۰ ساعت آموزشِ مختصِ هر وظیفه، این مدل به نرخ موفقیت ۷۵٪ دست یافت که به طور قابل توجهی از رقیب خود، Physical Intelligence، که تنها به ۴۰٪ رسید، بهتر است.
  • تسلط بر بنچمارک‌ها: این مدل با اختلاف زیاد در صدر جدول امتیازات RoboCasa365 قرار دارد، به‌ویژه در وظایف ترکیبی دیده‌نشده.
  • عملکرد در RoboDojo: امتیاز Xiaomi-Robotics-1 در بنچمارک RoboDojo تقریباً ۵۸٪ بالاتر از نفر دوم بود.

این مدل همچنین قدرت ویژه‌ای در کار با مواد نرم و تغییرشکل‌پذیر مانند کاغذ نشان داد؛ حوزه‌ای که از نظر تاریخی برای سیستم‌های رباتیک صلب (rigid) دشوار بوده است.

مسیری جدید برای صنعت رباتیک

رویکرد شیائومی در تقاطع با سایر غول‌های صنعت قرار دارد. در حالی که Nvidia تلاش می‌کند از طریق تولید داده‌های مصنوعی، مشکل داده‌های رباتیک را به یک مشکل محاسباتی تبدیل کند و مدل Orca از BAAI تلاش می‌کند از ویدئوهای بدون برچسب یاد بگیرد، شیائومی بر داده‌های حرکتیِ برچسب‌گذاری‌شده‌ی خودکار و در مقیاس بزرگ تمرکز مضاعف کرده است.

در حالی که شیائومی آماده می‌شود تا مدل و کد خود را در GitHub و Hugging Face منتشر کند، صنعت با دقت در حال نظاره‌گر این اتفاق است. این پیشرفت نشان می‌دهد که مرز بعدی رباتیک توسط کسانی فتح نخواهد شد که قدرتمندترین تراشه‌ها را دارند، بلکه توسط کسانی فتح می‌شود که متنوع‌ترین و بهترین برچسب‌گذاری‌شده‌ترین مجموعه‌داده‌های حرکتی را در اختیار دارند.

نکات کلیدی

  • مقیاس‌پذیری داده‌محور: افزایش حجم داده‌های آموزشی برای نرخ موفقیت رباتیک، مؤثرتر از افزایش اندازه مدل یا قدرت محاسباتی بود.
  • جمع‌آوری نوآورانه: گیره‌های دستی به شیائومی اجازه داد تا ۱۰۰,۰۰۰ ساعت داده حرکتی را در ۱۷۰۰ محیط مختلف، بدون نیاز به ربات‌های اختصاصی، جمع‌آوری کند.
  • تعمیم‌پذیری بالا: این مدل می‌تواند با کمتر از ۱۰ ساعت آموزش اضافی، به نرخ موفقیت ۷۵٪ در وظایف جدید دست یابد.