Gemini Omni de Google, al que se accede a través de la nueva interfaz de Google Vids, fue sometido a una prueba de laboratorio práctica para ver si la IA podía mantener la estabilidad de un único sujeto (un repartidor) tras tres ediciones de vídeo sucesivas.

Por qué es importante la prueba

Las herramientas de vídeo generativo prometen que cualquiera puede cambiar fondos, añadir iluminación o esparcir efectos con un solo comando de texto. Para un creador, la promesa es sencilla: empezar con un clip en bruto, escribir “haz que llueva de noche” y obtener un vídeo corto y pulido. La mayoría de los usuarios no ven el coste oculto del “drift” (deriva): la pérdida gradual de la apariencia, la pose o el movimiento del sujeto original a medida que la IA interpreta cada nueva instrucción. Si el rostro de un repartidor cambia sutilmente tras la segunda edición, la pieza final parecerá poco profesional y podría requerir una costosa limpieza manual.

El experimento

Clip de referencia – Una toma de estudio con cámara estática de una persona que viste un cortavientos azul marino, sostiene una pequeña caja de cartón con la mano izquierda y da dos pasos hacia la cámara. La iluminación era uniforme, el fondo era sencillo y el movimiento era simple.

Secuencia de edición – Se aplicaron tres ediciones una tras otra:

  1. Cambio de fondo – Reemplazar el estudio por una calle de la ciudad lluviosa por la noche.
  2. Ajuste de iluminación – Añadir una luz de contorno azul alrededor del repartidor y un brillo cálido proveniente del escaparate de una tienda.
  3. Capa de atmósfera – Esparcir ligeras gotas de lluvia y un fino velo de vapor.

Una ejecución de “control directo” combinó las tres instrucciones en un único prompt, permitiendo que la IA generara el clip final de una sola vez.

Cómo se puntuó la consistencia

Doce criterios conformaron la hoja de puntuación, agrupados en cuatro temas:

  • Estabilidad del personaje – El rostro, el cabello y la ropa permanecen idénticos.
  • Estabilidad de la escena – El ángulo de la cámara y la posición del sujeto se mantienen fijos.
  • Precisión de la edición – La IA sigue la instrucción sin alterar nada más.
  • Calidad temporal – No aparece parpadeo, deformación ni temblor durante el movimiento.

Cada clip fue evaluado en el primer fotograma, en el punto medio de la caminata de dos pasos y en el fotograma final. La puntuación reveló un patrón claro.

Lo que dicen los números

Cuando se apilaron las ediciones, la IA fue evaluada utilizando la hoja de puntuación. El control de prompt único recibió la misma evaluación.

Quién gana y quién pierde

Los estudios que pueden permitirse un único prompt exhaustivo obtienen un flujo de trabajo más fluido. Los desarrolladores de sistemas de vídeo generativo se enfrentan a un obstáculo de ingeniería claro: la necesidad de mantener una representación latente estable del sujeto a través de transformaciones secuenciales.

Contraargumento

Algunos usuarios argumentan que la edición incremental ofrece un mayor control creativo. Al ajustar un elemento a la vez, pueden perfeccionar cada capa antes de continuar. La prueba muestra que esta flexibilidad tiene un coste en la fidelidad visual. Si un creador acepta cambios menores en el sujeto a cambio de un control granular, el flujo de trabajo actual de Gemini Omni puede seguir siendo viable.

Qué observar a continuación

  • Refinamientos del modelo que bloqueen el código latente del sujeto a través de los prompts.
  • Bucles de retroalimentación del usuario que permitan a los creadores señalar la deriva y solicitar un “re-anclaje” del sujeto.

Conclusión

Gemini Omni puede producir un vídeo pulido y con múltiples elementos cuando se le proporciona un conjunto completo de instrucciones a la vez, pero su fidelidad con el sujeto se erosiona cuando las ediciones se apilan.