Most creative software still expects a human to sit between the idea and the finished file. You might describe a video edit to an AI, but the actual work of trimming clips, adjusting layers, and exporting frames usually falls back to you. That gap exists because media editing is not a single prompt-and-response task. It is a long chain of dependent decisions where step three only makes sense if step two actually changed the timeline. A recently shared project tackles this exact friction by wiring Claude Code into a stateful video editing pipeline powered by the Gemini Interactions API. The result is a working demonstration of how to get an AI agent to truly direct a creative workflow rather than simply suggest one.
Um Diretor e um Editor
A arquitetura é intencionalmente dividida. O Claude Code opera como o diretor, lidando com o planejamento de alto nível, interpretando briefings criativos vagos e decidindo o que precisa acontecer a seguir. Ele divide um pedido como “corte o silêncio e adicione um cartão de título” em tarefas discretas e, em seguida, monitora se cada tarefa foi bem-sucedida antes de prosseguir.
A Gemini Interactions API lida com a lógica de edição especializada. Em vez de forçar um modelo generalista a simular um editor de vídeo, esta configuração usa a API do Google como o operador prático que executa cortes, avalia o estado da linha do tempo e reporta resultados concretos. O sistema não funde ambos os trabalhos em um único modelo. Ele mantém a camada de raciocínio separada da camada de uso de ferramentas, o que significa que cada parte pode se concentrar no que faz de melhor.
Essa divisão reflete como as equipes reais de pós-produção funcionam. Um diretor conhece a história e toma as decisões. O editor conhece o software e manipula os pixels. Quando um agente tenta fazer ambos dentro de uma única janela de contexto, ele frequentemente tropeça na sintaxe ou esquece qual clipe está em qual trilha. Dividir a carga resolve isso.
Por que a Memória Muda Tudo
A edição de vídeo é inerentemente baseada em estado (stateful). Se você encurtar um clipe em quatro segundos, cada transição, sinal sonoro e posicionamento de legenda subsequente deve mudar para acompanhar. A maioria dos agentes de IA tem dificuldade aqui porque trata cada etapa como uma consulta isolada. Eles podem recomendar um corte em uma resposta e, na próxima, alucinar uma linha do tempo diferente ou sugerir um efeito para um segmento que não existe mais.
A Gemini Interactions API foi construída para manter o estado ao longo dessas operações. Ela rastreia a condição real do projeto enquanto o agente trabalha. Isso significa que o sistema sabe se uma exportação falhou, se um clipe já foi processado ou se uma gradação de cor foi aplicada. Quando o Claude emite a próxima instrução, ele está trabalhando com base no estado real atual da linha do tempo, não em um palpite.
Para quem já viu uma IA sugerir com confiança uma correção “simples” de cinco etapas que ignora completamente as quatro etapas anteriores, o valor do estado persistente é óbvio. Tarefas criativas se degradam rapidamente sem memória. Um backend com estado transforma um chatbot em um participante que pode realmente concluir um trabalho.
Como é o Fluxo de Trabalho
Imagine uma sequência prática. Você fornece ao sistema vários clipes brutos e pede um corte finalizado para redes sociais. O Claude Code primeiro avalia a solicitação. Ele pode decidir que a filmagem precisa de estabilização, depois uma extração de narração, depois legendas e, por fim, um corte vertical. Ele estrutura isso como um plano e começa a chamar a Gemini Interactions API para executar cada item em ordem.
O Gemini realiza as operações de mídia e retorna feedback estruturado. Talvez a estabilização tenha funcionado, mas a separação de áudio tenha encontrado diálogos sobrepostos que tornam as legendas pouco confiáveis. O Claude recebe essa atualização, revisa o plano e pede ao Gemini para tentar uma abordagem diferente, como identificar segmentos de falantes antes de gerar sobreposições de texto. Como a API mantém o estado, ela pode confirmar que a trilha de legendas está alinhada com o vídeo recém-estabilizado, e não com a filmagem trêmula original.
Esse loop continua até que a lista de tarefas seja concluída. O sistema cria um fluxo de trabalho genuíno para tarefas de vídeo complexas, em vez de uma geração de script pontual. Se uma renderização falhar porque uma configuração de codec é incompatível, o erro é enviado de volta ao Claude, que pode ajustar os parâmetros e tentar novamente. O agente não abandona o projeto após o primeiro obstáculo.
Usando Modelos Diferentes para Diferentes Forças
O projeto também ilustra um padrão de design mais amplo na engenharia de IA: pare de tentar fazer com que um único modelo faça tudo. O Claude Code se destaca ao raciocinar através de instruções ambíguas, gerenciar lógica de ramificação e manter o contexto conversacional ao longo de uma sessão longa. A Gemini Interactions API, particularmente em sua interação com mídia rica e uso de ferramentas, traz capacidades multimodais profundas e execução com estado. Ao conectá-los, você contorna as limitações de cada um.
Um modelo de raciocínio que nunca tocou em um editor não linear ainda pode dirigir um ótimo corte se tiver acesso a uma camada de execução que entenda codecs, keyframes e hierarquias de trilhas. Por outro lado, uma API especialista em mídia não precisa interpretar notas criativas abstratas se um modelo planejador já as tiver traduzido em etapas concretas. Os pontos fortes de um corrigem as fraquezas do outro.
Isso não é teórico. A configuração demonstra explicitamente como diferentes modelos de IA trabalham juntos para lidar com uma categoria de trabalho, a edição criativa de vídeo, que agentes de modelo único frequentemente não conseguem concluir. Para desenvolvedores que constroem sistemas de agentes, a lição é difícil de ignorar. Pare de pedir que sua camada de orquestração seja seu especialista, e pare de pedir que seu especialista seja seu estrategista.
O que os Desenvolvedores Devem Aprender
Você não precisa gerenciar um estúdio de vídeo para achar esse padrão útil. Qualquer domínio que exija um trabalho de múltiplas etapas em um ambiente em constante mudança — fluxos de trabalho de CAD, engenharia de áudio, visualização de dados ou computação científica — pode adotar a mesma estrutura. Um modelo atua como o gerente de projeto persistente. Uma API ou ferramenta especializada lida com as operações com estado dentro do software específico do domínio.
O trabalho do desenvolvedor muda de escrever prompts gigantes torcendo para que o modelo se lembre de tudo, para projetar transferências limpas entre o raciocínio e a execução. O gerenciamento de estado torna-se a peça crítica. Se o seu agente não consegue ver o que mudou após sua última ação, ele não pode agir de forma confiável novamente.
Você pode ler a análise completa de como a integração funciona, incluindo as interações específicas de API e a estrutura do projeto, no post detalhado em dev.to.
A Lição Principal
Resolver trabalhos criativos complexos com IA não exige esperar por um único modelo perfeito que possa planejar, lembrar e executar tudo de uma vez. Exige dar ao agente uma memória que sobreviva entre as etapas e um especialista para quem ele possa realmente delegar. Deixe o pensador pensar. Deixe o editor editar.
