Era sztucznej inteligencji istniejącej wyłącznie w świecie cyfrowym ewoluuje, gdy startupy starają się zasypać przepaść między inteligencją oprogramowania a fizycznym wykonaniem. Perceptron, nowy startup założony przez byłych badaczy Meta AI, przewodzi temu trendowi, rozwijając pionierskie modele wizyjne, które mają pomóc maszynom nawigować i wchodzić w interakcje z rzeczywistym światem.

Przełamywanie dychotomii: modele ogólne vs modele wąskie

Przez lata automatyzacja przemysłowa znajdowała się w technicznej pułapce. Programiści musieli zazwyczaj wybierać między potężnymi, ogólnymi modelami fundamentowymi, które wymagają drogich, dedykowanych procesorów GPU w chmurze dla każdej pojedynczej instancji, a wąskimi, wyspecjalizowanymi modelami, które potrafią zajmować się percepcją lub sterowaniem, ale nie potrafią robić obu tych rzeczy jednocześnie.

Współzałożyciele Perceptron, Armen Aghajanyan i Akshat Shrivastava — obaj absolwenci działu Fundamental AI Research (FAIR) w Meta — próbują rozwiązać ten problem za pomocą swojego nowego modelu, Isaac 0.5. W przeciwieństwie do istniejącego oprogramowania zaprojektowanego do pojedynczych, powtarzalnych zadań, Isaac 0.5 jest modelem ogólnego przeznaczenia. Zapewnia on robotom zdolność do „postrzegania, rozumowania i działania”, co pozwala im adaptować się do różnych środowisk, zamiast być zaprogramowanymi na jeden konkretny ruch.

Mechanika inteligencji fizycznej

Aby zrozumieć złożoność podejścia Perceptron, należy przyjrzeć się standardowemu zadaniu magazynowemu, takiemu jak sortowanie paczek. Robot nie może po prostu „podnieść pudełka”; musi najpierw odczytać etykiety, przeprowadzić analizę przestrzenną w celu zmapowania otoczenia, zdecydować o optymalnej kolejności podnoszenia i zaplanować swoją trajektorię fizyczną.

Isaac 0.5 został zaprojektowany do zarządzania tymi wieloetapowymi procesami poznawczymi. Model został przeszkolony na ogromną skalę, przetwarzając milion godzin ogólnych danych wideo, aby rozpoznawać różnorodne otoczenia i scenariusze. Aby opanować sprawność fizyczną, firma wykorzystała „wideo ego” (perspektywę pierwszej osoby z kamer noszonych) oraz wideo UMI (nagrania powtarzalnych ludzkich czynności), aby nauczyć AI, jak ruch przekłada się na wykonanie zadania. Shrivastava zauważył, że firma zbudowała zbiory danych o skali petabajtowej, obejmujące obrazy, tekst, wideo i trajektorie robotów, aby osiągnąć ten poziom „algorytmicznej alchemii”.

Strategia otwartych wag i ekspansja rynkowa

W ruchu promującym przejrzystość i adopcję przez programistów, Perceptron udostępnia Isaac 0.5 jako model o otwartych wagach. Pozwala to badaczom i inżynierom na inspekcję parametrów i materiałów szkoleniowych, co jest kluczowym krokiem przy integrowaniu AI w środowiskach przemysłowych o wysokim stopniu ryzyka, gdzie przewidywalność jest najważniejsza.

Dzięki rundzie finansowania o wartości 21 mln USD, prowadzonej przez Bessemer Venture Partners, Perceptron pozycjonuje się jako warstwa inteligencji dla szerokiej gamy sektorów. Choć główny nacisk kładziony jest na logistykę i produkcję, firma widzi natychmiastowe zastosowania w bezpieczeństwie, mobilności, a nawet w mediach i rozrywce. Dostarczając elastyczną warstwę inteligencji, Perceptron dąży do transformacji sposobu, w jaki roboty sterowane wizyjnie operują w globalnym krajobrazie przemysłowym.

Kluczowe wnioski

  • Niwelowanie różnic: Isaac 0.5 ma na celu wyeliminowanie konieczności wyboru między zasobożernymi modelami ogólnymi a ograniczonymi modelami wąskimi poprzez zaoferowanie uniwersalnego frameworku „postrzegaj, rozumuj i działaj”.
  • Ogromna skala szkolenia: Model wykorzystuje milion godzin danych wideo, w tym wideo egocentryczne i UMI, aby uczyć roboty złożonych zadań przestrzennych i manualnych.
  • Dostępność dzięki otwartym wagom: Udostępniając Isaac 0.5 z otwartymi wagami, Perceptron umożliwia głębszą inspekcję i szybszą integrację pionierskiej wizyjnej AI w procesach przemysłowych.

Perceptron zaprezentował Isaac 0.5, model wizyjny o otwartych wagach, który obiecuje zapewnić robotom zunifikowany „mózg” działający w trybie „postrzegaj-rozumuj-działaj”. Startup pozyskał 21 mln USD przy wsparciu Bessemer Venture Partners i pozycjonuje model jako gotową do wdrożenia warstwę inteligencji dla logistyki, produkcji i innych rynków automatyzacji fizycznej.

Dlaczego ten debiut jest ważny

Roboty przemysłowe od dawna były zmuszone do dokonywania kompromisów. Wdrożenie potężnego, ogólnego modelu fundamentowego wiąże się z kosztami ciągłego dostępu do procesorów GPU w chmurze; pozostanie przy wąskim, wyspecjalizowanym systemie wizyjnym oznacza utratę elastyczności przy zmianie środowiska. Isaac 0.5 jest pozycjonowany jako rozwiązanie pośrednie — jeden model, który może obsługiwać percepcję, planowanie i sterowanie bez konieczności korzystania z obliczeń w chmurze dla każdej instancji.

Problem z dzisiejszymi „mózgami” robotów

Typowy robot magazynowy robi więcej niż tylko chwyta pudełko. Musi odczytać etykietę, zlokalizować przedmiot wśród bałaganu, zdecydować o najlepszej kolejności pobierania i obliczyć trajektorię ramienia wolną od kolizji – a wszystko to w czasie rzeczywistym. Istniejące rozwiązania zazwyczaj dzielą te kroki na oddzielne komponenty oprogramowania: lekki detektor etykiet, ręcznie zaprojektowany planer ruchu oraz kontroler oparty na regułach do realizacji zadań. To rozdzielenie generuje narzut integracyjny i ogranicza zdolność robota do adaptacji w przypadku pojawienia się nowego produktu, stylu opakowania lub układu.

Jak Isaac 0.5 próbuje zasypać tę lukę

Współzałożyciele Perceptron, Armen Aghajanyan i Akshat Shrivastava, obaj byli wcześniej badaczami w Meta FAIR, zbudowali Isaac 0.5 jako pojedynczą sieć typu end-to-end. Model został wytrenowany na około milionie godzin ogólnych danych wideo, obejmujących szeroką gamę scen wewnętrznych i zewnętrznych. Co kluczowe, zbiór treningowy zawiera również „ego video” – nagrania z perspektywy pierwszej osoby wykonane za pomocą kamer noszonych – oraz „UMI video”, czyli nagrania powtarzalnych ludzkich czynności. Dzięki podawaniu sieci strumieni wizualnych sparowanych z danymi o trajektorii robota, Perceptron twierdzi, że model uczy się, jak wskazówki wizualne przekładają się na ruchy fizyczne.

Firma podaje, że jej zbiór danych obejmuje petabajty obrazów, tekstu, wideo i trajektorii robotycznych. Ta szeroka skala ma zapewnić Isaac 0.5 zdolność do rozpoznawania nowych obiektów, wnioskowania o ich właściwościach użytkowych (affordances – czyli tym, jak można je chwycić) oraz generowania planu ruchu, a wszystko to bez oddzielnego modułu sterującego.

Model z otwartymi wagami: przejrzystość spotyka praktyczność

W przeciwieństwie do większości komercyjnych ofert AI, które udostępniają jedynie API, Perceptron wydaje Isaac 0.5 z otwartymi wagami. Inżynierowie mogą sprawdzać parametry, dostrajać sieć na własnych danych lub osadzać model bezpośrednio na sprzęcie typu edge.