Xiaomi-Robotics-1 يثبت أن حجم البيانات يتفوق على حجم النموذج في مجال الروبوتات
كشفت شركة Xiaomi عن Xiaomi-Robotics-1، وهو نموذج تأسيسي رائد يغير نموذج تدريب الروبوتات من زيادة قدرات الحوسبة إلى التوسع الهائل في البيانات. ومن خلال الاستفادة من طريقة فريدة لجمع البيانات، أظهر النموذج قدرة غير مسبوقة على التكيف في البيئات غير المألوفة ومهام المناولة المعقدة.
كسر "عنق زجاجة البيانات" باستخدام القابضات المحمولة باليد
لطالما كان التحدي الرئيسي في مجال الروبوتات هو "عنق زجاجة البيانات" — أي صعوبة جمع كميات هائلة من بيانات التفاعل عالية الجودة دون الحاجة إلى أذرع روبوتية ثابتة ومكلفة. وقد تجاوزت Xiaomi ذلك باستخدام قابضات محمولة باليد ومزودة بكاميرات.
وبدلاً من برمجة الروبوتات، استخدم المشغلون البشريون هذه الأجهزة المحمولة لتسجيل مهام المناولة عبر أكثر من 1,700 بيئة متنوعة، بما في ذلك المطابخ والمكاتب والمصانع. وقد أسفر هذا النهج عن تسجيل مذهل لـ 100,000 ساعة من تسجيلات الحركة. ولحل مشكلة التصنيف (labeling)، استخدمت Xiaomi نموذج ذكاء اصطناعي لإنشاء أوصاف نصية تلقائياً لكل مقطع حركي، مما أدى إلى إتمام تصنيف مجموعة البيانات بأكملها في غضون أسبوعين فقط.
قانون التوسع: البيانات تتفوق على الحوسبة
تكمن الرؤية التقنية الجوهرية من بحث Xiaomi-Robotics-1 في أن زيادة بيانات التدريب تحقق مكاسب في الأداء أعلى بكثير من مجرد زيادة حجم النموذج أو قدرات الحوسبة. وبينما تساهم النماذج الأكبر في تقليل أخطاء التنبؤ، إلا أن معدل نجاح الروبوت في البيئات غير المألوفة قفز من 25% إلى 75% مع زيادة حجم بيانات التدريب.
ويعكس هذا الاتجاهات المشهودة في مجال الرؤية الحاسوبية، حيث توفر إضافة البيانات قيمة أكبر من زيادة عدد المعلمات (parameters). وبالنسبة لشركة Xiaomi، فإن هذا يعني أن الطريق نحو ذكاء اصطناعي للروبوتات متعدد الأغراض يكمن في تنوع ونطاق مجموعات البيانات بدلاً من مجرد بناء شبكات عصبية أكبر.
قدرة لا تضاهى على التكيف وأداء استثنائي في الاختبارات المعيارية
تم تصميم Xiaomi-Robotics-1 لاتباع الأوامر المنطوقة أو المكتوبة والتكيف مع المهام الجديدة بأقل قدر من الضبط الدقيق (fine-tuning). وفي الاختبارات، كُلِّف النموذج بمناورات معقدة مثل تحميل الغسيل، وتغذية الطابعة بالورق، وتعبئة حقائب السفر.
وكانت النتائج حاسمة:
- التكيف السريع: مع أقل من 10 ساعات من التدريب المخصص للمهمة، حقق النموذج معدل نجاح بنسبة 75%، متفوقاً بشكل كبير على المنافس Physical Intelligence الذي حقق 40% فقط.
- الهيمنة على الاختبارات المعيارية: يتصدر النموذج قائمة RoboCasa365 بفارق كبير، لا سيما في المهام المركبة غير المرئية مسبقاً.
- الأداء في RoboDojo: سجل Xiaomi-Robotics-1 درجة أعلى بنسبة 58% تقريباً من الوصيف في اختبار RoboDojo المعياري.
كما أظهر النموذج قوة خاصة في التعامل مع المواد اللينة والقابلة للتشكيل مثل الورق، وهو مجال كان صعباً تاريخياً على الأنظمة الروبوتية الصلبة.
توجه جديد لصناعة الروبوتات
يقع نهج Xiaomi عند مفترق طرق مع عمالقة الصناعة الآخرين. فبينما تحاول Nvidia تحويل مشكلة بيانات الروبوتات إلى مشكلة حوسبة من خلال توليد البيانات الاصطناعية، ويحاول نموذج Orca التابع لـ BAAI التعلم من الفيديو غير المصنف، تضاعف Xiaomi رهانها على بيانات الحركة المصنفة والآلية واسعة النطاق.
وبينما تستعد Xiaomi لإصدار النموذج والتعليمات البرمجية على GitHub و Hugging Face، يراقب قطاع الصناعة ذلك عن كثب. ويشير هذا التطور إلى أن الحدود التالية للروبوتات لن يسيطر عليها من يمتلكون أقوى الرقائق، بل من يمتلكون مجموعات بيانات حركة أكثر تنوعاً وتصنيفاً بدقة.
النقاط الرئيسية
- التوسع المتمحور حول البيانات: أثبتت زيادة حجم بيانات التدريب أنها أكثر فعالية في معدلات نجاح الروبوتات من زيادة حجم النموذج أو قدرات الحوسبة.
- الجمع المبتكر: سمحت القابضات المحمولة لشركة Xiaomi بجمع 100,000 ساعة من بيانات الحركة عبر 1,700 بيئة دون الحاجة إلى روبوتات مخصصة.
- قدرة عالية على التعميم: يمكن للنموذج تحقيق معدل نجاح بنسبة 75% في المهام الجديدة مع أقل من 10 ساعات من التدريب الإضافي.
