Gemini Omni de Google, accessible via la nouvelle interface Google Vids, a été soumis à un test pratique en laboratoire pour voir si l'IA pouvait maintenir la stabilité d'un même sujet (un coursier) après trois modifications vidéo successives.

Pourquoi ce test est important

Les outils de vidéo générative promettent à n'importe qui de pouvoir changer d'arrière-plan, d'ajouter de l'éclairage ou de parsemer des effets par une simple commande textuelle. Pour un créateur, la promesse est simple : partir d'un clip brut, taper « fais tomber la pluie la nuit », et obtenir un court métrage abouti. La plupart des utilisateurs ne voient pas le coût caché de la « dérive » (drift) — la perte progressive de l'apparence, de la pose ou du mouvement du sujet original à mesure que l'IA interprète chaque nouvelle instruction. Si le visage d'un coursier change subtilement après la deuxième modification, le résultat final manque de professionnalisme et peut nécessiter un nettoyage manuel coûteux.

L'expérience

Clip de référence – Un plan de studio avec caméra fixe montrant une personne portant un coupe-vent bleu marine, tenant une petite boîte en carton dans la main gauche et faisant deux pas vers la caméra. L'éclairage était uniforme, l'arrière-plan neutre et le mouvement simple.

Séquence de modifications – Trois modifications ont été appliquées l'une après l'autre :

  1. Changement d'arrière-plan – Remplacer le studio par une rue de ville pluvieuse la nuit.
  2. Ajustement de l'éclairage – Ajouter un éclairage de contour bleu autour du coursier et une lueur chaleureuse provenant de la vitrine d'un magasin.
  3. Couche d'atmosphère – Parsemer de légères gouttes de pluie et un mince voile de vapeur.

Un essai de « contrôle direct » a combiné les trois instructions dans un seul prompt, permettant à l'IA de générer le clip final en une seule fois.

Comment la cohérence a été évaluée

Douze critères ont constitué la grille d'évaluation, regroupés en quatre thèmes :

  • Stabilité du personnage – Le visage, les cheveux et les vêtements restent identiques.
  • Stabilité de la scène – L'angle de la caméra et la position du sujet restent fixes.
  • Précision de la modification – L'IA suit l'instruction sans rien altérer d'autre.
  • Qualité temporelle – Aucun scintillement, déformation ou tremblement n'apparaît pendant le mouvement.

Chaque clip a été évalué à la première image, au milieu de la marche en deux pas, et à l'image finale. La notation a révélé un schéma clair.

Ce que disent les chiffres

Lorsque les modifications étaient cumulées, l'IA était évaluée à l'aide de la grille. L'essai de contrôle par prompt unique a reçu la même évaluation.

Qui gagne et qui perd

Les studios qui peuvent se permettre un prompt unique et complet bénéficient d'un flux de travail plus fluide. Les développeurs de systèmes de vidéo générative sont confrontés à un défi technique majeur : la nécessité de maintenir une représentation latente stable du sujet à travers des transformations séquentielles.

Contre-argument

Certains utilisateurs soutiennent que l'édition incrémentale offre un meilleur contrôle créatif. En ajustant un élément à la fois, ils peuvent affiner chaque couche avant de passer à la suivante. Le test montre que cette flexibilité se fait au détriment de la fidélité visuelle. Si un créateur accepte de légères modifications du sujet pour un contrôle granulaire, le flux de travail actuel de Gemini Omni peut encore être viable.

À surveiller prochainement

  • L'affinement des modèles qui verrouillent le code latent du sujet à travers les prompts.
  • Des boucles de rétroaction utilisateur permettant aux créateurs de signaler la dérive et de demander un « ré-ancrage » du sujet.

À retenir

Gemini Omni peut produire une vidéo aboutie comportant plusieurs éléments lorsqu'il reçoit un ensemble complet d'instructions en une seule fois, mais la fidélité du sujet s'érode lorsque les modifications sont cumulées.