Google’s Gemini Omni, toegankelijk via de nieuwe Google Vids-interface, is onderworpen aan een praktische labtest om te zien of de AI een enkele koerier als onderwerp stabiel kon houden na drie opeenvolgende videobewerkingen.

Waarom de test belangrijk is

Generatieve videotools beloven dat iedereen achtergronden kan wisselen, belichting kan toevoegen of effecten kan strooien met één enkele tekstopdracht. Voor een maker is de belofte simpel: begin met een ruwe clip, typ "laat het 's nachts regenen" en eindig met een gepolijste korte video. De meeste gebruikers zien de verborgen kosten van "drift" niet — het geleidelijke verlies van het uiterlijk, de houding of de beweging van het oorspronkelijke onderwerp terwijl de AI elke nieuwe instructie interpreteert. Als het gezicht van een koerier subtiel verandert na de tweede bewerking, ziet het eindresultaat er onprofessioneel uit en is er mogelijk kostbare handmatige nabewerking nodig.

Het experiment

Basisclip – Een studio-opname met een statische camera van één persoon in een marineblauwe windbreaker, die een klein kartonnen doosje in de linkerhand houdt en twee stappen richting de camera zet. De belichting was gelijkmatig, de achtergrond neutraal en de beweging eenvoudig.

Bewerkingsreeks – Er werden drie bewerkingen achter elkaar toegepast:

  1. Achtergrondwissel – Vervang de studio door een regenachtige stadstraat in de nacht.
  2. Belichtingsaanpassing – Voeg een blauw randlicht toe rond de koerier en een warme gloed van een etalage.
  3. Atmosferische laag – Voeg lichte regendruppels en een dunne sluier van stoom toe.

Een "directe controle"-run combineerde alle drie de instructies in één enkele prompt, waardoor de AI de uiteindelijke clip in één keer kon genereren.

Hoe consistentie werd gescoord

Twaalf criteria vormden de scorekaart, gegroepeerd in vier thema's:

  • Karakterstabiliteit – Gezicht, haar en kleding blijven identiek.
  • Scènestabiliteit – Camerahoek en positie van het onderwerp blijven vaststaan.
  • Bewerkingsprecisie – De AI volgt de instructie zonder iets anders te veranderen.
  • Temporele kwaliteit – Geen flikkering, vervorming of jitter tijdens beweging.

Elke clip werd geëvalueerd bij het eerste frame, het middelpunt van de twee stappen en het laatste frame. De score gaf een duidelijk patroon aan.

Wat de cijfers zeggen

Wanneer bewerkingen werden gestapeld, werd de AI met de scorekaart geëvalueerd. De controle met de enkele prompt kreeg dezelfde evaluatie.

Wie wint en wie verliest

Studio's die een enkele, uitgebreide prompt kunnen gebruiken, profiteren van een soepelere workflow. Ontwikkelaars van generatieve videosystemen staan voor een duidelijke technische uitdaging: de noodzaak om een stabiele latente representatie van het onderwerp te behouden tijdens opeenvolgende transformaties.

Tegenargument

Sommige gebruikers beweren dat incrementele bewerking meer creatieve controle biedt. Door telkens één element aan te passen, kunnen ze elke laag verfijnen voordat ze verdergaan. De test laat zien dat deze flexibiliteit ten koste gaat van de visuele getrouwheid. Als een maker kleine veranderingen in het onderwerp accepteert in ruil voor fijnmazige controle, is de huidige Gemini Omni-workflow mogelijk nog steeds levensvatbaar.

Volgende ontwikkelingen om in de gaten te houden

  • Modelverfijningen die de latente code van het onderwerp vergrendelen over verschillende prompts heen.
  • User-feedbackloops waarmee makers "drift" kunnen melden en een "herverankering" van het onderwerp kunnen aanvragen.

Kernboodschap

Gemini Omni kan een gepolijste video met meerdere elementen produceren wanneer er in één keer een volledige set instructies wordt gegeven, maar de getrouwheid van het onderwerp neemt af wanneer bewerkingen worden gestapeld.