Gemini Omni di Google, accessibile tramite la nuova interfaccia Google Vids, è stato sottoposto a un test di laboratorio pratico per verificare se l'IA fosse in grado di mantenere stabile un singolo soggetto (un corriere) dopo tre modifiche video successive.

Perché il test è importante

Gli strumenti di video generazione promettono che chiunque possa cambiare lo sfondo, aggiungere illuminazione o spargere effetti con un singolo comando testuale. Per un creatore, la promessa è semplice: parti da una clip grezza, scrivi "fai piovere di notte" e ottieni un breve video rifinito. La maggior parte degli utenti non vede il costo nascosto del "drift" (deriva): la perdita graduale dell'aspetto, della posa o del movimento del soggetto originale man mano che l'IA interpreta ogni nuova istruzione. Se il volto di un corriere cambia sottilmente dopo la seconda modifica, il risultato finale sembrerà poco professionale e potrebbe richiedere costosi interventi manuali di pulizia.

L'esperimento

Clip di base – Un'inquadratura da studio con telecamera statica di una persona che indossa un giubbotto a vento blu navy, tiene una piccola scatola di cartone nella mano sinistra e fa due passi verso la telecamera. L'illuminazione era uniforme, lo sfondo semplice e il movimento elementare.

Sequenza di modifiche – Sono state applicate tre modifiche una dopo l'altra:

  1. Sostituzione dello sfondo – Sostituire lo studio con una strada cittadina sotto la pioggia di notte.
  2. Regolazione dell'illuminazione – Aggiungere una luce di contorno (rim light) blu attorno al corriere e un bagliore caldo proveniente dalla vetrina di un negozio.
  3. Livello atmosferico – Aggiungere leggere gocce di pioggia e un sottile velo di vapore.

Una prova a "controllo diretto" ha accoppiato tutte e tre le istruzioni in un unico prompt, permettendo all'IA di generare la clip finale in un colpo solo.

Come è stata valutata la coerenza

Dodici criteri hanno costituito la scheda di valutazione, raggruppati in quattro temi:

  • Stabilità del personaggio – Viso, capelli e abbigliamento rimangono identici.
  • Stabilità della scena – L'angolazione della telecamera e la posizione del soggetto rimangono fisse.
  • Precisione della modifica – L'IA segue l'istruzione senza alterare nient'altro.
  • Qualità temporale – Nessun sfarfallio, distorsione o tremolio appare durante il movimento.

Ogni clip è stata valutata al primo fotogramma, a metà della camminata di due passi e all'ultimo fotogramma. La valutazione ha rivelato un modello chiaro.

Cosa dicono i numeri

Quando le modifiche venivano accumulate, l'IA veniva valutata utilizzando la scheda di valutazione. Il controllo con prompt singolo ha ricevuto la stessa valutazione.

Chi vince e chi perde

Gli studi che possono permettersi un singolo prompt completo ottengono un flusso di lavoro più fluido. Gli sviluppatori di sistemi di video generazione si trovano di fronte a una chiara sfida ingegneristica: la necessità di mantenere una rappresentazione latente stabile del soggetto attraverso trasformazioni sequenziali.

Controargomentazione

Alcuni utenti sostengono che l'editing incrementale offra un maggiore controllo creativo. Regolando un elemento alla volta, possono perfezionare ogni livello prima di procedere. Il test dimostra che questa flessibilità ha un costo in termini di fedeltà visiva. Se un creatore accetta lievi cambiamenti del soggetto in cambio di un controllo granulare, l'attuale flusso di lavoro di Gemini Omni potrebbe essere ancora praticabile.

Cosa osservare in futuro

  • Raffinamenti del modello che blocchino il codice latente del soggetto attraverso i prompt.
  • Cicli di feedback degli utenti che consentano ai creatori di segnalare la deriva e richiedere un "re-ancoraggio" del soggetto.

In sintesi

Gemini Omni può produrre un video rifinito e multi-elemento quando riceve un set completo di istruzioni tutto in una volta, ma la fedeltà del soggetto si deteriora quando le modifiche vengono accumulate.