Die Ära der rein digitalen KI entwickelt sich weiter, während Startups versuchen, die Lücke zwischen Software-Intelligenz und physischer Ausführung zu schließen. Perceptron, ein neues Unternehmen, das von ehemaligen Meta AI-Forschern gegründet wurde, führt diese Entwicklung an, indem es wegweisende Vision-Modelle entwickelt, die Maschinen dabei helfen sollen, sich in der realen Welt zu bewegen und mit ihr zu interagieren.

Das binäre Dilemma: Generalistische vs. spezialisierte Modelle

Seit Jahren steckt die industrielle Automatisierung in einer technischen Sackgasse fest. Entwickler mussten sich in der Regel zwischen massiven, generalistischen Foundation-Modellen entscheiden, die für jede einzelne Instanz teure, dedizierte Cloud-GPUs erfordern, oder zwischen spezialisierten, engen Modellen, die zwar Wahrnehmung oder Steuerung übernehmen können, aber nicht beides gleichzeitig leisten.

Die Mitbegründer von Perceptron, Armen Aghajanyan und Akshat Shrivastava – beide Absolventen der Fundamental AI Research (FAIR)-Abteilung von Meta – versuchen, dieses Problem mit ihrem neuen Modell Isaac 0.5 zu lösen. Im Gegensatz zu bestehender Software, die für einzelne, repetitive Aufgaben konzipiert ist, ist Isaac 0.5 ein Allzweckmodell. Es verleiht Robotern die Fähigkeit zu „wahrnehmen, schlussfolgern und handeln“ (perceive, reason, and act), wodurch sie sich an verschiedene Umgebungen anpassen können, anstatt für eine einzige spezifische Bewegung fest programmiert zu sein.

Die Mechanik physischer Intelligenz

Um die Komplexität des Ansatzes von Perceptron zu verstehen, muss man sich eine Standardaufgabe im Lager ansehen, wie etwa das Sortieren von Paketen. Ein Roboter kann nicht einfach „eine Kiste aufheben“; er muss zuerst Etiketten lesen, eine räumliche Analyse durchführen, um seine Umgebung zu erfassen, sich für eine optimale Greifreihenfolge entscheiden und seine physische Trajektorie planen.

Isaac 0.5 ist darauf ausgelegt, diese mehrstufigen kognitiven Prozesse zu bewältigen. Das Modell wurde in massivem Umfang trainiert und hat eine Million Stunden allgemeiner Videodaten verarbeitet, um unterschiedliche Umgebungen und Szenarien zu erkennen. Um physische Geschicklichkeit zu meistern, nutzte das Unternehmen „Ego-Video“ (Perspektiven aus der Ich-Perspektive von tragbaren Kameras) und UMI-Video (Aufnahmen repetitiver menschlicher Handlungen), um der KI beizubringen, wie Bewegung in die Erledigung einer Aufgabe übersetzt wird. Shrivastava merkte an, dass das Unternehmen Datensätze im Petabyte-Bereich aufgebaut hat, die Bilder, Text, Video und Roboter-Trajektorien umfassen, um dieses Niveau an „algorithmischer Alchemie“ zu erreichen.

Open-Weight-Strategie und Marktexpansion

In einem Schritt, der Transparenz und die Akzeptanz durch Entwickler fördert, veröffentlicht Perceptron Isaac 0.5 als Open-Weight-Modell. Dies ermöglicht es Forschern und Ingenieuren, die Parameter und Trainingsmaterialien zu untersuchen – ein entscheidender Schritt für die Integration von KI in hochsensible industrielle Umgebungen, in denen Vorhersehbarkeit an oberster Stelle steht.

Unterstützt durch eine Finanzierungsrunde in Höhe von 21 Millionen US-Dollar unter der Leitung von Bessemer Venture Partners, positioniert sich Perceptron als die Intelligenzschicht für eine Vielzahl von Sektoren. Während der Schwerpunkt primär auf Logistik und Fertigung liegt, sieht das Unternehmen unmittelbare Anwendungen in den Bereichen Sicherheit, Mobilität und sogar Medien und Unterhaltung. Durch die Bereitstellung einer flexiblen Intelligenzschicht strebt Perceptron danach, die Arbeitsweise von visionsgesteuerten Robotern in der gesamten globalen Industrielandschaft zu transformieren.

Wichtigste Erkenntnisse

  • Die Lücke schließen: Isaac 0.5 zielt darauf ab, die Wahl zwischen ressourcenintensiven generalistischen Modellen und eingeschränkten spezialisierten Modellen zu eliminieren, indem es ein vielseitiges „Wahrnehmen, Schlussfolgern, Handeln“-Framework bietet.
  • Massiver Trainingsumfang: Das Modell nutzt eine Million Stunden Videodaten, einschließlich ego-zentrischer und UMI-Videos, um Robotern komplexe räumliche und manuelle Aufgaben beizubringen.
  • Open-Weight-Zugänglichkeit: Durch die Veröffentlichung von Isaac 0.5 mit offenen Gewichten ermöglicht Perceptron eine tiefere Untersuchung und eine schnellere Integration von wegweisender Vision-KI in industrielle Arbeitsabläufe.

Perceptron hat Isaac 0.5 vorgestellt, ein Open-Weight-Vision-Modell, das Robotern ein einheitliches „Wahrnehmen-Schlussfolgern-Handeln“-Gehirn verspricht. Das Startup sammelte 21 Millionen US-Dollar ein, angeführt von Bessemer Venture Partners, und positioniert das Modell als direkt einsetzbare Intelligenzschicht für die Logistik, die Fertigung und andere Märkte der physischen Automatisierung.

Warum die Markteinführung wichtig ist

Industrielle Roboter waren lange Zeit gezwungen, Kompromisse einzugehen. Setzt man ein massives, vielseitiges Foundation-Modell ein, zahlt man für den ständigen Zugriff auf Cloud-GPUs; hält man an einem spezialisierten, aufgabenbezogenen Visionssystem fest, verliert man an Flexibilität, sobald sich die Umgebung ändert. Isaac 0.5 wird als Mittelweg vermarktet – ein Modell, das Wahrnehmung, Planung und Steuerung bewältigen kann, ohne dass für jede Instanz Cloud-Rechenleistung benötigt wird.

Das Problem mit den heutigen Robotergehirnen

Ein typischer Lagerroboter tut mehr, als nur eine Kiste zu greifen. Er muss ein Etikett lesen, den Artikel inmitten von Unordnung lokalisieren, die beste Pick-Sequenz entscheiden und eine kollisionsfreie Armtrajektorie berechnen – und das alles in Echtzeit. Bestehende Lösungen teilen diese Schritte meist auf verschiedene Softwarekomponenten auf: einen leichtgewichtigen Detektor für das Etikett, einen handgefertigten Planer für die Bewegung und einen regelbasierten Controller für die Ausführung. Diese Aufteilung führt zu Integrationsaufwand und schränkt die Fähigkeit des Roboters ein, sich an neue Produkte, Verpackungsstile oder Layouts anzupassen.

Wie Isaac 0.5 versucht, die Lücke zu schließen

Die Mitbegründer von Perceptron, Armen Aghajanyan und Akshat Shrivastava, beide ehemalige Forscher bei Meta FAIR, haben Isaac 0.5 als ein einziges End-to-End-Netzwerk entwickelt. Das Modell wurde mit etwa einer Million Stunden allgemeiner Videodaten trainiert, die eine große Vielfalt an Innen- und Außenaufnahmen abdecken. Entscheidend ist, dass der Trainingsdatensatz auch „Ego-Video“ – aus der Ich-Perspektive von tragbaren Kameras aufgenommene Aufnahmen – und „UMI-Video“, Aufzeichnungen repetitiver menschlicher Handlungen, umfasst. Durch die Einspeisung von visuellen Streams, gepaart mit Roboter-Trajektoriendaten, in das Netzwerk behauptet Perceptron, dass das Modell lernt, wie visuelle Hinweise in physische Bewegungen übersetzt werden.

Das Unternehmen gibt an, dass sein Datensatz Petabytes an Bildern, Texten, Videos und Roboter-Trajektorien umfasst. Diese Breite soll Isaac 0.5 die Fähigkeit verleihen, ein neues Objekt zu erkennen, seine Affordanzen (wie es gegriffen werden kann) abzuleiten und einen Bewegungsplan zu erstellen – und das alles ohne ein separates Steuerungsmodul.

Open-Weight-Modell: Transparenz trifft auf Praktikabilität

Im Gegensatz zu den meisten kommerziellen KI-Angeboten, die nur eine API bereitstellen, veröffentlicht Perceptron Isaac 0.5 mit offenen Gewichten. Ingenieure können die Parameter inspizieren, das Netzwerk mit proprietären Daten feinabstimmen oder das Modell direkt auf Edge-Hardware einbetten.