Gemini Omni od Google, dostępny poprzez nowy interfejs Google Vids, został poddany praktycznym testom laboratoryjnym, aby sprawdzić, czy sztuczna inteligencja jest w stanie zachować stabilność pojedynczego obiektu (kuriera) po trzech kolejnych edycjach wideo.
Dlaczego ten test jest ważny
Narzędzia do generowania wideo obiecują, że każdy może zmienić tło, dodać oświetlenie lub rozproszyć efekty za pomocą pojedynczej komendy tekstowej. Dla twórcy obietnica jest prosta: zaczynasz od surowego klipu, wpisujesz „niech pada deszcz w nocy” i otrzymujesz dopracowany krótki film. Większość użytkowników nie dostrzega ukrytego kosztu „dryfu” (drift) – stopniowej utraty oryginalnego wyglądu, pozy lub ruchu obiektu, gdy AI interpretuje każdą nową instrukcję. Jeśli twarz kuriera subtelnie zmieni się po drugiej edycji, końcowy materiał będzie wyglądał nieprofesjonalnie i może wymagać kosztownej, ręcznej obróbki.
Eksperyment
Klip bazowy – ujęcie studyjne ze statyczną kamerą przedstawiające jedną osobę w granatowej wiatrówce, trzymającą małe kartonowe pudełko w lewej ręce i robiącą dwa kroki w stronę kamery. Oświetlenie było równomierne, tło jednolite, a ruch prosty.
Sekwencja edycji – Zastosowano trzy edycje jedna po drugiej:
- Zmiana tła – zastąpienie studia deszczową ulicą miasta nocą.
- Korekta oświetlenia – dodanie niebieskiego światła konturowego wokół kuriera oraz ciepłego blasku z witryny sklepowej.
- Warstwa atmosferyczna – dodanie lekkich kropel deszczu i cienkiej warstwy pary.
Próba typu „bezpośrednia kontrola” (direct control) połączyła wszystkie trzy instrukcje w jednym prompcie, pozwalając AI wygenerować końcowy klip za jednym razem.
Jak oceniano spójność
Kartę ocen tworzyło dwanaście kryteriów, pogrupowanych w cztery tematy:
- Stabilność postaci – twarz, włosy i ubranie pozostają identyczne.
- Stabilność sceny – kąt kamery i pozycja obiektu pozostają niezmienne.
- Precyzja edycji – AI stosuje się do instrukcji, nie zmieniając niczego innego.
- Jakość czasowa – brak migotania, zniekształceń lub drgań podczas ruchu.
Każdy klip był oceniany na pierwszej klatce, w połowie dwustopniowego kroku oraz na ostatniej klatce. Wyniki punktowe ujawniły wyraźny wzorzec.
Co mówią liczby
Gdy edycje były nakładane jedna po drugiej, AI oceniano przy użyciu karty ocen. Grupa kontrolna z pojedynczym promptem otrzymała taką samą ocenę.
Kto wygrywa, a kto przegrywa
Studia, których stać na przygotowanie pojedynczego, kompleksowego promptu, zyskują płynniejszy proces pracy. Twórcy systemów generowania wideo stają przed wyraźną barierą inżynieryjną – koniecznością utrzymania stabilnej reprezentacji ukrytej (latent representation) obiektu podczas sekwencyjnych transformacji.
Kontrargument
Niektórzy użytkownicy twierdzą, że edycja przyrostowa oferuje większą kontrolę kreatywną. Dostosowując jeden element naraz, mogą oni dopracować każdą warstwę przed przejściem do kolejnej. Test pokazuje jednak, że ta elastyczność odbywa się kosztem wierności wizualnej. Jeśli twórca zaakceptuje drobne zmiany wyglądu obiektu w zamian za szczegółową kontrolę, obecny proces pracy w Gemini Omni może być nadal użyteczny.
Na co warto zwrócić uwagę w przyszłości
- Udoskonalenia modeli, które „zablokują” kod ukryty (latent code) obiektu w różnych promptach.
- Pętle informacji zwrotnej od użytkowników, pozwalające twórcom zgłaszać dryf i prosić o „ponowne zakotwiczenie” (re-anchor) obiektu.
Podsumowanie
Gemini Omni potrafi wygenerować dopracowany, wieloelementowy film, gdy otrzyma komplet instrukcji naraz, jednak wierność odwzorowania obiektu pogarsza się, gdy edycje są nakładane jedna po drugiej.
