Wycena PixVerse przekracza 2 mld USD po rundzie finansowania o wartości 439 mln USD

Singapurski startup zajmujący się generowaniem wideo, PixVerse, pozyskał ogromną kwotę 439 milionów dolarów w ramach rozszerzenia rundy serii C, co podniosło jego wycenę powyżej poziomu 2 miliardów dolarów. Ten zastrzyk kapitału pozycjonuje firmę jako potężnego gracza w szybko rozwijającym się sektorze generatywnego wideo i modeli świata (world models).

Skalowanie modeli świata i globalny zasięg w sektorze przedsiębiorstw

Nowo pozyskane fundusze zostały przeznaczone na dwa główne cele: rozszerzenie specjalistycznej oferty modeli świata PixVerse oraz zwiększenie globalnej obecności w sektorze przedsiębiorstw. Firma wykracza już poza narzędzia konsumenckie, dzięki zawarciu strategicznej umowy z Alibaba na wdrożenie swoich funkcji generowania wideo.

Zatrudniając 150 pracowników w Singapurze, Pekinie i Szanghaju, PixVerse planuje wykorzystać tę płynność finansową do agresywnego pozyskiwania wyspecjalizowanych badaczy AI oraz specjalistów ds. wprowadzania produktów na rynek (go-to-market). Ekspansja ta następuje w krytycznym momencie, gdy firma przygotowuje się do uruchomienia nowego modelu generowania wideo V-Series oraz zaktualizowanej wersji swoich modeli świata R-Series jeszcze w tym roku.

Strategia wielopoziomowych modeli dla każdego zastosowania

W przeciwieństwie do generycznych generatorów wideo, PixVerse opracował segmentowaną architekturę zaprojektowaną do obsługi różnych pionów rynkowych:

  • V-Series: Zoptymalizowana pod kątem aplikacji konsumenckich i integracji API.
  • C-Series: Dostosowana do zaawansowanych profesjonalnych procesów produkcji filmowej i reklamowej.
  • R-Series: Dedykowane „modele świata” zaprojektowane specjalnie z myślą o tworzeniu gier i immersyjnym budowaniu światów.

Możliwości techniczne są imponujące, oferując użytkownikom możliwość generowania wideo w rozdzielczości do 4K z zintezowaną ścieżką dźwiękową. Dynamika wzrostu startupu jest już widoczna – firma chwali się ponad 150 milionami zarejestrowanych użytkowników oraz 15 milionami aktywnych użytkowników miesięcznie (MAU). Dla programistów i twórców platforma oferuje konkurencyjne ceny, np. 4,80 USD za minutę generowania wideo z obrazu (image-to-video).

Sekretny składnik: Precyzyjne etykietowanie danych

W erze, w której wysokiej jakości dane wideo stają się towarem powszechnym, współzałożyciel PixVerse, Jaden Xie, twierdzi, że prawdziwa przewaga konkurencyjna tkwi w etykietowaniu danych, a nie w samej objętości surowych danych. Wykorzystując doświadczenie współzałożyciela Wang Changhu z ByteDance — gdzie budował technologię rozumienia obrazu stojącą za TikTokiem — PixVerse stosuje zaawansowaną wizję komputerową do etykietowania danych treningowych z niespotykaną dotąd dokładnością.

To skupienie na „rozumieniu”, a nie tylko na „generowaniu”, odróżnia ich od konkurentów takich jak Meta czy Tencent, którzy według Xie mieli trudności z dotrzymaniem wysokich standardów jakości wymaganych w wideo profesjonalnej klasy.

Przepełniony i ryzykowny krajobraz konkurencyjny

Sukces rundy finansowania PixVerse podkreśla intensywny wyścig o dominację w sektorze AI wideo. Firma mierzy się z silną konkurencją zarówno ze strony graczy wschodnich, jak i zachodnich. W Azji rywalami są model Seedance od ByteDance oraz Kling AI, natomiast zachodni liderzy to Runway, Luma i Midjourney. Co więcej, na froncie „modeli świata” obserwujemy ogromne inwestycje w elitarnych startupach badawczych powiązanych z gigantami branżowymi, takimi jak Yann LeCun i Fei-Fei Li.

Kluczowe wnioski

  • Ogromny wzrost wyceny: PixVerse osiągnął wycenę przekraczającą 2 mld USD po rozszerzeniu serii C o 439 mln USD, w którą zaangażowani byli inwestorzy tacy jak Alibaba i Mirae Asset.
  • Specjalistyczna architektura modeli: Firma wyróżnia się trójpoziomowym systemem modeli (V-Series, C-Series i R-Series), skierowanym do konsumentów, profesjonalistów oraz twórców gier.
  • Etykietowanie jako przewaga: PixVerse wykorzystuje głęboką wiedzę z zakresu wizji komputerowej i precyzyjne etykietowanie danych, aby osiągnąć wyższą jakość wideo w porównaniu do ogólnych modeli AI.