La plupart des logiciels créatifs exigent encore qu'un humain fasse le lien entre l'idée et le fichier final. Vous pouvez décrire un montage vidéo à une IA, mais le travail réel de découpage de clips, d'ajustement de couches et d'exportation de frames vous incombe généralement. Cet écart existe parce que le montage multimédia n'est pas une simple tâche de type « prompt-réponse ». C'est une longue chaîne de décisions dépendantes où la troisième étape n'a de sens que si la deuxième a réellement modifié la timeline. Un projet récemment partagé s'attaque précisément à cette friction en connectant Claude Code à un pipeline de montage vidéo avec état (stateful), propulsé par l'API Gemini Interactions. Le résultat est une démonstration concrète de la manière dont un agent IA peut véritablement diriger un flux de travail créatif plutôt que de simplement en suggérer un.
Un réalisateur et un monteur
L'architecture est intentionnellement divisée. Claude Code opère en tant que réalisateur, gérant la planification de haut niveau, interprétant des briefs créatifs vagues et décidant de la suite des opérations. Il décompose une requête telle que « coupe les silences et ajoute un carton de titre » en tâches distinctes, puis surveille la réussite de chaque tâche avant de passer à la suivante.
L'API Gemini Interactions gère la logique de montage spécialisée. Au lieu de forcer un modèle généraliste à simuler un monteur vidéo, cette configuration utilise l'API de Google comme l'opérateur de terrain qui exécute les coupes, évalue l'état de la timeline et rend compte avec des résultats concrets. Le système ne fusionne pas ces deux rôles en un seul modèle. Il maintient la couche de raisonnement séparée de la couche d'utilisation d'outils, ce qui signifie que chaque partie peut se concentrer sur ce qu'elle fait de mieux.
Cette division reflète le fonctionnement des véritables équipes de postproduction. Un réalisateur connaît l'histoire et prend les décisions. Le monteur connaît le logiciel et manipule les pixels. Lorsqu'un agent tente de faire les deux au sein d'une seule fenêtre de contexte, il trébuche souvent sur la syntaxe ou oublie quel clip se trouve sur quelle piste. Diviser la charge de travail résout ce problème.
Pourquoi la mémoire change tout
Le montage vidéo est intrinsèquement lié à l'état (stateful). Si vous raccourcissez un clip de quatre secondes, chaque transition, signal audio et placement de sous-titre subséquent doit se décaler pour correspondre. La plupart des agents IA peinent ici car ils traitent chaque étape comme une requête isolée. Ils peuvent recommander une coupe dans une réponse, puis halluciner une timeline différente dans la suivante, ou suggérer un effet pour un segment qui n'existe plus.
L'API Gemini Interactions est conçue pour maintenir l'état à travers ces opérations. Elle suit l'état réel du projet au fur et à mesure que l'agent travaille. Cela signifie que le système sait si un export a échoué, si un clip a déjà été traité ou si un étalonnage a été appliqué. Lorsque Claude émet l'instruction suivante, il travaille sur l'état actuel réel de la timeline, et non sur une supposition.
Pour quiconque a déjà vu une IA suggérer avec assurance une correction « simple » en cinq étapes qui ignore complètement les quatre étapes précédentes, la valeur d'un état persistant est évidente. Les tâches créatives se dégradent rapidement sans mémoire. Un backend avec gestion d'état transforme un chatbot en un participant capable de mener réellement une tâche à son terme.
À quoi ressemble le flux de travail
Imaginez une séquence pratique. Vous fournissez au système plusieurs clips bruts et demandez un montage fini pour les réseaux sociaux. Claude Code évalue d'abord la requête. Il peut décider que les images ont besoin d'une stabilisation, puis d'une extraction de voix off, puis de sous-titres, puis d'un recadrage vertical. Il structure cela sous forme de plan et commence à appeler l'API Gemini Interactions pour exécuter chaque élément dans l'ordre.
Gemini effectue les opérations multimédias et renvoie un retour structuré. Peut-être que la stabilisation a réussi, mais que la séparation audio a révélé des dialogues qui se chevauchent, rendant les sous-titres peu fiables. Claude reçoit cette mise à jour, révise le plan et demande à Gemini d'essayer une approche différente, comme l'identification des segments de locuteurs avant de générer les incrustations de texte. Comme l'API conserve l'état, elle peut confirmer que la piste de sous-titres s'aligne sur la vidéo nouvellement stabilisée, et non sur les images tremblantes d'origine.
Cette boucle continue jusqu'à ce que la liste de contrôle soit terminée. Le système crée un véritable flux de travail pour des tâches vidéo complexes au lieu d'une simple génération de script ponctuelle. Si un rendu échoue parce qu'un paramètre de codec est incompatible, l'erreur est renvoyée à Claude, qui peut ajuster les paramètres et réessayer. L'agent n'abandonne pas le projet après le premier obstacle.
Utiliser différents modèles pour exploiter leurs forces respectives
The project also illustrates a broader design pattern in AI engineering: stop trying to make one model do it all. Claude Code excels at reasoning through ambiguous instructions, managing branching logic, and maintaining conversational context over a long session. The Gemini Interactions API, particularly in its interaction with rich media and tool use, brings deep multimodal capabilities and stateful execution. By wiring them together, you route around the limits of each.
A reasoning model that has never touched a nonlinear editor can still direct a great cut if it has access to an execution layer that understands codecs, keyframes, and track hierarchies. Conversely, a media-savvy API does not need to parse abstract creative notes if a planner model has already translated them into concrete steps. The strengths of one fix the weaknesses of the other.
This is not theoretical. The setup explicitly demonstrates how different AI models work together to handle a category of work, creative video editing, that single-model agents often fail to finish. For developers building agentic systems, the lesson is hard to ignore. Stop asking your orchestration layer to be your specialist, and stop asking your specialist to be your strategist.
What Builders Should Take Away
You do not need to be running a video studio to find this pattern useful. Any domain that requires multi-step work over a changing environment, CAD workflows, audio engineering, data visualization, or scientific computing, can borrow the same structure. One model acts as the persistent project manager. A specialized API or tool handles the stateful operations inside the domain-specific software.
The developer’s job shifts from writing giant prompts that pray the model remembers everything, to designing clean handoffs between reasoning and execution. State management becomes the critical piece. If your agent cannot see what changed after its last action, it cannot reliably act again.
You can read the full breakdown of how the integration works, including the specific API interactions and project structure, in the detailed post on dev.to.
The Real Takeaway
Solving complex creative work with AI does not require waiting for a single, perfect model that can plan, remember, and execute everything at once. It requires giving the agent a memory that survives between steps and a specialist it can actually delegate to. Let the thinker think. Let the editor edit.
