O Gemini Omni do Google, acessado por meio da nova interface do Google Vids, foi submetido a um teste prático de laboratório para verificar se a IA conseguiria manter a estabilidade de um único sujeito-entregador após três edições de vídeo sucessivas.
Por que o teste é importante
Ferramentas de vídeo generativo prometem que qualquer pessoa pode trocar fundos, adicionar iluminação ou espalhar efeitos com um único comando de texto. Para um criador, a promessa é simples: comece com um clipe bruto, digite “faça chover à noite” e saia com um vídeo curto e polido. A maioria dos usuários não percebe o custo oculto do “drift” — a perda gradual da aparência, pose ou movimento do sujeito original à medida que a IA interpreta cada nova instrução. Se o rosto de um entregador mudar sutilmente após a segunda edição, a peça final parecerá pouco profissional e poderá exigir uma limpeza manual dispendiosa.
O experimento
Clipe de referência – Uma filmagem de estúdio com câmera estática de uma pessoa vestindo um corta-vento azul-marinho, segurando uma pequena caixa de papelão na mão esquerda e dando dois passos em direção à câmera. A iluminação era uniforme, o fundo era simples e o movimento era básico.
Sequência de edição – Três edições foram aplicadas uma após a outra:
- Troca de fundo – Substituir o estúdio por uma rua de cidade chuvosa à noite.
- Ajuste de iluminação – Adicionar uma luz de contorno azul ao redor do entregador e um brilho quente vindo da vitrine de uma loja.
- Camada de atmosfera – Adicionar gotas de chuva leves e um fino véu de vapor.
Uma execução de “controle direto” combinou as três instruções em um único prompt, permitindo que a IA gerasse o clipe final de uma só vez.
Como a consistência foi pontuada
Doze critérios formaram a planilha de pontuação, agrupados em quatro temas:
- Estabilidade do personagem – Rosto, cabelo e roupas permanecem idênticos.
- Estabilidade da cena – O ângulo da câmera e a posição do sujeito permanecem fixos.
- Precisão da edição – A IA segue a instrução sem alterar mais nada.
- Qualidade temporal – Sem cintilação, distorção ou trepidação durante o movimento.
Cada clipe foi avaliado no primeiro quadro, no meio do passo de dois passos e no quadro final. A pontuação revelou um padrão claro.
O que os números dizem
Quando as edições foram empilhadas, a IA foi avaliada usando a planilha de pontuação. O controle de prompt único recebeu a mesma avaliação.
Quem ganha e quem perde
Estúdios que podem arcar com um único prompt abrangente ganham um fluxo de trabalho mais fluido. Desenvolvedores de sistemas de vídeo generativo enfrentam um obstáculo de engenharia claro — a necessidade de manter uma representação latente estável do sujeito através de transformações sequenciais.
Contra-argumento
Alguns usuários argumentam que a edição incremental oferece mais controle criativo. Ao ajustar um elemento de cada vez, eles podem refinar cada camada antes de prosseguir. O teste mostra que essa flexibilidade custa fidelidade visual. Se um criador aceitar pequenas mudanças no sujeito em troca de um controle granular, o fluxo de trabalho atual do Gemini Omni ainda pode ser viável.
O que observar a seguir
- Refinamentos de modelo que bloqueiam o código latente do sujeito entre os prompts.
- Loops de feedback do usuário que permitem aos criadores sinalizar o drift e solicitar um “re-ancoramento” do sujeito.
Conclusão
O Gemini Omni pode produzir um vídeo polido e com múltiplos elementos quando recebe um conjunto completo de instruções de uma só vez, mas sua fidelidade ao sujeito se deteriora quando as edições são empilhadas.
