Alibaba wprowadza Wan3.0: Nowa definicja multimodalnej generacji wideo AI

Alibaba oficjalnie weszło w fazę beta modelu Wan3.0 – potężnego, nowego modelu generowania wideo, zdolnego do tworzenia wysokiej jakości klipów o długości do 30 sekund. Dzięki rozszerzeniu możliwości wejściowych o dokumenty i złożone prompty multimodalne, Wan3.0 pozycjonuje się jako wszechstronne narzędzie dla twórców, marketerów oraz inżynierów robotyki.

Dwukrotne wydłużenie czasu trwania i rozszerzenie wejść multimodalnych

Wan3.0 stanowi znaczący skok w porównaniu do swojego poprzednika, Wan2.5, podwajając maksymalny czas trwania wideo do 30 sekund. Tym, co naprawdę wyróżnia ten model, jest jego zaawansowany silnik przetwarzania multimodalnego. W przeciwieństwie do tradycyjnych narzędzi typu text-to-video, Wan3.0 potrafi jednocześnie przetwarzać tekst, obrazy, wideo oraz dźwięk.

Model obsługuje niezwykle złożone prompty, pozwalając użytkownikom na dołączenie do dziesięciu obrazów, pięciu filmów i pięciu klipów audio w ramach jednego zapytania. Być może najbardziej imponujące jest to, że Wan3.0 potrafi przetwarzać nietypowe media, takie jak pliki PDF, strony internetowe czy prezentacje PowerPoint, skutecznie przekształcając statyczne dokumenty profesjonalne w dynamiczne treści wideo. System zawiera nawet inteligentną funkcję, która rekomenduje optymalną długość wideo na podstawie konkretnego promptu użytkownika.

Rozwiązanie problemu dryfu wizualnego (visual drift)

Jedną z najbardziej uporczywych przeszkód w generowaniu wideo przez AI jest „dryf wizualny” (visual drift) – tendencja postaci, rysów twarzy i układów przestrzennych do zniekształcania się lub nienaturalnej zmiany w czasie. Alibaba zaprojektowała Wan3.0 specjalnie po to, aby zwalczać te niespójności.

Poprzez priorytetowe traktowanie zachowania szczegółów z materiałów referencyjnych, model utrzymuje znacznie wyższą wierność postaci, rekwizytów i złożonych interfejsów użytkownika. Skupienie na spójności czasowej sprawia, że model jest znacznie bardziej użyteczny w profesjonalnych procesach pracy, gdzie tożsamość marki i ciągłość postaci są kwestiami bezdyskusyjnymi.

Skalowalne ceny i zastosowania branżowe

Wan3.0 jest dostępny za pośrednictwem strony wan.video, Alibaba Cloud Model Studio lub poprzez API w Qwen Cloud. Alibaba oferuje dwa odrębne poziomy: wersję Standard (obecnie z 30% zniżką) oraz szybką wersję Prime. Ceny skalują się wraz z rozdzielczością – od 1,50 USD za 30-sekundowy klip 480p w pakiecie Standard do 8,40 USD za klip 1080p w pakiecie Prime.

Strategia wdrożenia celuje w trzy odrębne sektory:

  • Rozrywka: Przyspieszenie produkcji filmowej oraz generowanie krótkich dramatów lub klipów do mediów społecznościowych.
  • Przedsiębiorstwa: Przekształcanie tekstów marketingowych i instrukcji szkoleniowych w angażujące zasoby wideo.
  • Deep Tech: Dostarczanie realistycznych materiałów symulacyjnych do trenowania pojazdów autonomicznych i systemów robotycznych.

Premiera ta następuje po potężnym zastrzyku kapitałowym od Alibaba, która niedawno przeprowadziła dużą sprzedaż akcji, aby sfinansować agresywną ekspansję w dziedzinie AI, nawet jeśli wysokie koszty inwestycji wpłynęły na kwartalne zyski.

Kluczowe wnioski

  • Ulepszona multimodalność: Wan3.0 potrafi przekształcać pliki PDF, prezentacje PowerPoint i strony internetowe w wideo, obsługując złożone prompty z wykorzystaniem do 20 połączonych zasobów multimedialnych.
  • Poprawiona spójność: Model w szczególny sposób rozwiązuje problem dryfu wizualnego, zapewniając lepszą stabilność postaci, rekwizytów i środowisk w klipach trwających 30 sekund.
  • Szerokie zastosowanie: Zaprojektowany dla szerokiego spektrum użytkowników – od twórców treści potrzebujących klipów do mediów społecznościowych, po inżynierów wymagających danych symulacyjnych do szkolenia robotyki.