L'ère de l'IA exclusivement numérique évolue à mesure que les startups cherchent à combler le fossé entre l'intelligence logicielle et l'exécution physique. Perceptron, une nouvelle entreprise fondée par d'anciens chercheurs de Meta AI, mène cette charge en développant des modèles de vision de pointe conçus pour aider les machines à naviguer et à interagir avec le monde réel.
Briser la binarité : modèles généralistes vs modèles spécialisés
Pendant des années, l'automatisation industrielle est restée bloquée dans une impasse technique. Les développeurs devaient généralement choisir entre des modèles de fondation généralistes massifs, qui nécessitent des GPU cloud dédiés et coûteux pour chaque instance, ou des modèles spécialisés et étroits, capables de gérer la perception ou le contrôle, mais incapables de faire les deux.
Les cofondateurs de Perceptron, Armen Aghajanyan et Akshat Shrivastava — tous deux anciens de la division Fundamental AI Research (FAIR) de Meta — tentent de résoudre ce problème grâce à leur nouveau modèle, Isaac 0.5. Contrairement aux logiciels existants conçus pour des tâches uniques et répétitives, Isaac 0.5 est un modèle polyvalent. Il donne aux robots la capacité de « percevoir, raisonner et agir », leur permettant de s'adapter à divers environnements plutôt que d'être programmés de manière rigide pour un mouvement spécifique.
La mécanique de l'intelligence physique
Pour comprendre la complexité de l'approche de Perceptron, il faut examiner une tâche d'entrepôt standard, comme le tri de colis. Un robot ne peut pas simplement « ramasser une boîte » ; il doit d'abord lire les étiquettes, effectuer une analyse spatiale pour cartographier son environnement, décider d'un ordre de ramassage optimal et planifier sa trajectoire physique.
Isaac 0.5 est conçu pour gérer ces processus cognitifs multi-étapes. Le modèle a été entraîné à une échelle massive, ingérant un million d'heures de données vidéo générales pour reconnaître divers contextes et scénarios. Pour maîtriser la dextérité physique, l'entreprise a utilisé la « vidéo ego » (perspectives à la première personne provenant de caméras portables) et la vidéo UMI (enregistrements d'actions humaines répétitives) pour apprendre à l'IA comment le mouvement se traduit par l'accomplissement d'une tâche. Shrivastava a noté que l'entreprise a construit des ensembles de données à l'échelle du pétaoctet comprenant des images, du texte, de la vidéo et des trajectoires robotiques pour atteindre ce niveau d'« alchimie algorithmique ».
Stratégie de poids ouverts et expansion du marché
Dans une démarche qui encourage la transparence et l'adoption par les développeurs, Perceptron publie Isaac 0.5 en tant que modèle à poids ouverts (open-weight). Cela permet aux chercheurs et aux ingénieurs d'inspecter ses paramètres et ses supports d'entraînement, une étape cruciale pour intégrer l'IA dans des environnements industriels à enjeux élevés où la prévisibilité est primordiale.
Soutenue par une levée de fonds de 21 millions de dollars menée par Bessemer Venture Partners, Perceptron se positionne comme la couche d'intelligence pour un large éventail de secteurs. Bien que l'accent soit mis principalement sur la logistique et la fabrication, l'entreprise voit des applications immédiates dans la sécurité, la mobilité et même les médias et le divertissement. En fournissant une couche d'intelligence flexible, Perceptron vise à transformer la manière dont les robots guidés par la vision opèrent dans le paysage industriel mondial.
Points clés
- Combler le fossé : Isaac 0.5 vise à éliminer le choix entre des modèles généralistes gourmands en ressources et des modèles spécialisés limités en proposant un cadre polyvalent de « perception, raisonnement et action ».
- Échelle d'entraînement massive : Le modèle exploite un million d'heures de données vidéo, y compris des vidéos ego-centriques et UMI, pour enseigner aux robots des tâches spatiales et manuelles complexes.
- Accessibilité des poids ouverts : En publiant Isaac 0.5 avec des poids ouverts, Perceptron permet une inspection plus approfondie et une intégration plus rapide de l'IA de vision de pointe dans les flux de travail industriels.
Perceptron a dévoilé Isaac 0.5, un modèle de vision à poids ouverts qui promet de donner aux robots un cerveau unifié « percevoir-raisonner-agir ». La startup a levé 21 millions de dollars, sous l'égide de Bessemer Venture Partners, et positionne le modèle comme une couche d'intelligence prête à l'emploi pour la logistique, la fabrication et d'autres marchés de l'automatisation physique.
Pourquoi ce lancement est important
Les robots industriels ont longtemps été contraints à un compromis. Déployez un modèle de fondation massif et polyvalent, et vous payez pour un accès constant aux GPU cloud ; restez avec un système de vision spécialisé et limité, et vous perdez en flexibilité lorsque l'environnement change. Isaac 0.5 est commercialisé comme le juste milieu : un modèle capable de gérer la perception, la planification et le contrôle sans nécessiter de calcul cloud par instance.
Le problème des cerveaux robotiques actuels
Un robot d'entrepôt typique fait bien plus que simplement saisir une boîte. Il doit lire une étiquette, localiser l'article au milieu du désordre, décider de la meilleure séquence de prélèvement et calculer une trajectoire de bras sans collision — le tout en temps réel. Les solutions existantes répartissent généralement ces étapes entre différents composants logiciels : un détecteur léger pour l'étiquette, un planificateur de mouvement conçu à la main et un contrôleur basé sur des règles pour l'exécution. Cette séparation crée une surcharge d'intégration et limite la capacité du robot à s'adapter lorsqu'un nouveau produit, un nouveau style d'emballage ou une nouvelle disposition apparaît.
Comment Isaac 0.5 tente de combler l'écart
Les cofondateurs de Perceptron, Armen Aghajanyan et Akshat Shrivastava, tous deux anciens chercheurs chez Meta FAIR, ont conçu Isaac 0.5 comme un réseau unique de bout en bout. Le modèle a été entraîné sur environ un million d'heures de données vidéo générales, couvrant une grande variété de scènes en intérieur et en extérieur. Élément crucial, l'ensemble d'entraînement inclut également de l'« ego video » — des séquences à la première personne capturées par des caméras portables — et de l'« UMI video », des enregistrements d'actions humaines répétitives. En alimentant le réseau avec des flux visuels couplés à des données de trajectoire de robot, Perceptron affirme que le modèle apprend comment les indices visuels se traduisent en mouvements physiques.
L'entreprise affirme que son ensemble de données s'étend sur des pétaoctets d'images, de texte, de vidéos et de trajectoires robotiques. Cette étendue vise à donner à Isaac 0.5 la capacité de reconnaître un nouvel objet, d'en déduire les affordances (la manière dont il peut être saisi) et de générer un plan de mouvement, le tout sans module de contrôle séparé.
Modèle à poids ouverts : la transparence au service de la praticité
Contrairement à la plupart des offres d'IA commerciales qui ne proposent qu'une API, Perceptron publie Isaac 0.5 avec des poids ouverts. Les ingénieurs peuvent inspecter les paramètres, affiner le réseau sur des données propriétaires ou intégrer le modèle directement sur du matériel edge.
