La maggior parte dei software creativi richiede ancora la presenza di un essere umano tra l'idea e il file finito. Potresti descrivere un montaggio video a un'IA, ma il lavoro effettivo di ritaglio delle clip, regolazione dei livelli ed esportazione dei fotogrammi ricade solitamente su di te. Questo divario esiste perché l'editing multimediale non è un singolo compito di prompt e risposta. È una lunga catena di decisioni dipendenti in cui il terzo passaggio ha senso solo se il secondo ha effettivamente modificato la timeline. Un progetto condiviso recentemente affronta esattamente questa frizione collegando Claude Code a una pipeline di editing video stateful alimentata dalla Gemini Interactions API. Il risultato è una dimostrazione funzionante di come far dirigere a un agente IA un vero workflow creativo, anziché limitarsi a suggerirne uno.

Un regista e un montatore

L'architettura è intenzionalmente suddivisa. Claude Code opera come il regista, occupandosi della pianificazione di alto livello, interpretando brief creativi vaghi e decidendo cosa deve accadere successivamente. Scompone una richiesta come "taglia i tempi morti e aggiungi una title card" in compiti discreti, monitorando poi se ogni compito ha successo prima di procedere.

La Gemini Interactions API gestisce la logica di editing specializzata. Invece di costringere un modello generalista a simulare un editor video, questa configurazione utilizza l'API di Google come operatore pratico che esegue i tagli, valuta lo stato della timeline e riferisce con risultati concreti. Il sistema non accorpa entrambi i lavori in un unico modello. Mantiene il livello di ragionamento separato dal livello di utilizzo degli strumenti, il che significa che ogni parte può concentrarsi su ciò che sa fare meglio.

Questa divisione rispecchia il modo in cui funzionano i veri team di post-produzione. Un regista conosce la storia e prende le decisioni. Il montatore conosce il software e manipola i pixel. Quando un agente cerca di fare entrambe le cose all'interno di una singola finestra di contesto, spesso inciampa nella sintassi o dimentica quale clip si trova su quale traccia. Dividere il carico risolve il problema.

Perché la memoria cambia tutto

L'editing video è intrinsecamente stateful. Se accorci una clip di quattro secondi, ogni successiva transizione, segnale audio e posizionamento dei sottotitoli deve spostarsi per adattarsi. La maggior parte degli agenti IA fatica in questo ambito perché tratta ogni passaggio come una query isolata. Potrebbero raccomandare un taglio in una risposta, per poi allucinare una timeline diversa nella successiva, o suggerire un effetto per un segmento che non esiste più.

La Gemini Interactions API è progettata per mantenere lo stato attraverso queste operazioni. Monitora la condizione effettiva del progetto mentre l'agente lavora. Ciò significa che il sistema sa se un'esportazione è fallita, se una clip è già stata elaborata o se è stata applicata una correzione del colore. Quando Claude emette la successiva istruzione, sta lavorando rispetto allo stato reale e attuale della timeline, non su una supposizione.

Per chiunque abbia visto un'IA suggerire con sicurezza una correzione "semplice" in cinque passaggi che ignora completamente i quattro precedenti, il valore di uno stato persistente è evidente. I compiti creativi degradano rapidamente senza memoria. Un backend stateful trasforma una chatbot in un partecipante che può effettivamente portare a termine un lavoro.

Come appare il workflow

Immagina una sequenza pratica. Fornisci al sistema diverse clip grezze e chiedi un montaggio finito per i social media. Claude Code valuta prima la richiesta. Potrebbe decidere che il filmato necessita di stabilizzazione, poi di un'estrazione della voce fuori campo, poi di sottotitoli e infine di un ritaglio verticale. Struttura questi elementi come un piano e inizia a chiamare la Gemini Interactions API per eseguire ogni voce in ordine.

Gemini esegue le operazioni multimediali e restituisce un feedback strutturato. Magari la stabilizzazione ha avuto successo, ma la separazione audio ha rilevato dialoghi sovrapposti che rendono i sottotitoli inaffidabili. Claude riceve l'aggiornamento, rivede il piano e chiede a Gemini di provare un approccio diverso, come l'identificazione dei segmenti dei parlanti prima di generare i testi in sovrimpressione. Poiché l'API mantiene lo stato, può confermare che la traccia dei sottotitoli si allinea con il video appena stabilizzato, non con il filmato originale tremolante.

Questo ciclo continua finché la checklist non è completa. Il sistema crea un vero workflow per compiti video complessi invece di una generazione di script una tantum. Se un rendering fallisce perché un'impostazione del codec è incompatibile, l'errore risale a Claude, che può regolare i parametri e riprovare. L'agente non abbandona il progetto dopo il primo ostacolo.

Utilizzare modelli diversi per punti di forza diversi

The project also illustrates a broader design pattern in AI engineering: stop trying to make one model do it all. Claude Code excels at reasoning through ambiguous instructions, managing branching logic, and maintaining conversational context over a long session. The Gemini Interactions API, particularly in its interaction with rich media and tool use, brings deep multimodal capabilities and stateful execution. By wiring them together, you route around the limits of each.

A reasoning model that has never touched a nonlinear editor can still direct a great cut if it has access to an execution layer that understands codecs, keyframes, and track hierarchies. Conversely, a media-savvy API does not need to parse abstract creative notes if a planner model has already translated them into concrete steps. The strengths of one fix the weaknesses of the other.

This is not theoretical. The setup explicitly demonstrates how different AI models work together to handle a category of work, creative video editing, that single-model agents often fail to finish. For developers building agentic systems, the lesson is hard to ignore. Stop asking your orchestration layer to be your specialist, and stop asking your specialist to be your strategist.

What Builders Should Take Away

You do not need to be running a video studio to find this pattern useful. Any domain that requires multi-step work over a changing environment, CAD workflows, audio engineering, data visualization, or scientific computing, can borrow the same structure. One model acts as the persistent project manager. A specialized API or tool handles the stateful operations inside the domain-specific software.

The developer’s job shifts from writing giant prompts that pray the model remembers everything, to designing clean handoffs between reasoning and execution. State management becomes the critical piece. If your agent cannot see what changed after its last action, it cannot reliably act again.

You can read the full breakdown of how the integration works, including the specific API interactions and project structure, in the detailed post on dev.to.

The Real Takeaway

Solving complex creative work with AI does not require waiting for a single, perfect model that can plan, remember, and execute everything at once. It requires giving the agent a memory that survives between steps and a specialist it can actually delegate to. Let the thinker think. Let the editor edit.