Xiaomi-Robotics-1 beweist: Datenvolumen schlägt Modellgröße in der Robotik
Xiaomi hat Xiaomi-Robotics-1 vorgestellt, ein bahnbrechendes Foundation-Modell, das das Paradigma des Robotik-Trainings von der Erhöhung der Rechenleistung hin zu massivem Daten-Scaling verschiebt. Durch den Einsatz einer einzigartigen Datenerfassungsmethode demonstriert das Modell eine beispiellose Anpassungsfähigkeit in unbekannten Umgebungen und bei komplexen Manipulationsaufgaben.
Den Datenengpass mit Handgreifern überwinden
Die größte Herausforderung in der Robotik war schon immer der „Datenengpass“ – die Schwierigkeit, riesige Mengen an hochwertigen Interaktionsdaten zu sammeln, ohne teure, stationäre Roboterarme einzusetzen. Xiaomi umging dies durch den Einsatz von tragbaren Handgreifern, die mit Kameras ausgestattet sind.
Anstatt Roboter zu programmieren, nutzten menschliche Bediener diese Handgeräte, um Manipulationsaufgaben in mehr als 1.700 verschiedenen Umgebungen aufzuzeichnen, darunter Küchen, Büros und Fabriken. Dieser Ansatz lieferte beeindruckende 100.000 Stunden an Bewegungsaufzeichnungen. Um das Problem der Beschriftung (Labeling) zu lösen, setzte Xiaomi ein KI-Modell ein, das automatisch Textbeschreibungen für jedes Bewegungssegment generierte, wodurch die Kennzeichnung des gesamten Datensatzes in nur zwei Wochen abgeschlossen werden konnte.
Das Scaling Law: Daten vor Rechenleistung
Die zentrale technische Erkenntnis der Xiaomi-Robotics-1-Forschung ist, dass mehr Trainingsdaten deutlich höhere Leistungssteigerungen bewirken als eine bloße Erhöhung der Modellgröße oder der Rechenleistung. Während größere Modelle zwar Vorhersagefehler reduzieren, stieg die Erfolgsquote des Roboters in unbekannten Umgebungen mit zunehmendem Volumen der Trainingsdaten von 25 % auf 75 % an.
Dies spiegelt Trends aus dem Bereich Computer Vision wider, wo das Hinzufügen von Daten mehr Wert bietet als die Erhöhung der Parameteranzahl. Für Xiaomi bedeutet dies, dass der Weg zu einer universell einsetzbaren Roboter-KI (General Purpose Robot AI) in der Vielfalt und dem Umfang der Datensätze liegt und nicht allein im Bau größerer neuronaler Netze.
Unübertroffene Anpassungsfähigkeit und Benchmark-Leistung
Xiaomi-Robotics-1 ist darauf ausgelegt, gesprochenen oder geschriebenen Befehlen zu folgen und sich mit minimalem Fine-Tuning an neue Aufgaben anzupassen. In Tests wurde das Modell mit komplexen Manövern betraut, wie etwa dem Beladen von Wäsche, dem Einlegen von Papier in einen Drucker und dem Packen von Koffern.
Die Ergebnisse waren eindeutig:
- Schnelle Anpassung: Mit weniger als 10 Stunden aufgabenspezifischem Training erreichte das Modell eine Erfolgsquote von 75 % und übertraf damit den Konkurrenten Physical Intelligence, der nur 40 % erreichte, deutlich.
- Benchmark-Dominanz: Das Modell führt die RoboCasa365-Bestenliste mit großem Abstand an, insbesondere bei unbekannten zusammengesetzten Aufgaben (composite tasks).
- RoboDojo-Leistung: Xiaomi-Robotics-1 erzielte beim RoboDojo-Benchmark etwa 58 % höhere Werte als der Zweitplatzierte.
Das Modell zeigte zudem besondere Stärken im Umgang mit weichen, verformbaren Materialien wie Papier – ein Bereich, der für starre Robotersysteme historisch gesehen schwierig war.
Eine neue Richtung für die Robotikindustrie
Xiamis Ansatz steht an einem Scheideweg mit anderen Branchenriesen. Während Nvidia versucht, das Robotik-Datenproblem durch die Generierung synthetischer Daten in ein Rechenleistungsproblem zu verwandeln, und das Orca-Modell von BAAI versucht, aus unbeschrifteten Videos zu lernen, setzt Xiaomi verstärkt auf automatisierte, groß angelegte, beschriftete Bewegungsdaten.
Während Xiaomi die Veröffentlichung des Modells und des Codes auf GitHub und Hugging Face vorbereitet, beobachtet die Branche dies genau. Diese Entwicklung deutet darauf hin, dass die nächste Grenze der Robotik nicht von denen erschlossen wird, die die leistungsstärksten Chips besitzen, sondern von denen, die über die vielfältigsten und am besten beschrifteten Bewegungsdatensätze verfügen.
Wichtigste Erkenntnisse
- Datenzentriertes Scaling: Die Erhöhung des Trainingsdatenvolumens erwies sich für die Erfolgsquoten in der Robotik als effektiver als die Vergrößerung der Modellgröße oder der Rechenleistung.
- Innovative Datenerfassung: Handgreifer ermöglichten es Xiaomi, 100.000 Stunden Bewegungsdaten in 1.700 Umgebungen zu sammeln, ohne dedizierte Roboter zu benötigen.
- Hohe Generalisierung: Das Modell kann bei neuen Aufgaben mit weniger als 10 Stunden zusätzlichem Training eine Erfolgsquote von 75 % erreichen.
