De meeste creatieve software verwacht nog steeds dat er een mens tussen het idee en het voltooide bestand zit. Je kunt een videobewerking misschien beschrijven aan een AI, maar het eigenlijke werk van het inkorten van clips, het aanpassen van lagen en het exporteren van frames komt meestal weer bij jou terecht. Die kloof bestaat omdat media-editing geen enkele prompt-en-antwoord-taak is. Het is een lange keten van afhankelijke beslissingen waarbij stap drie alleen zinvol is als stap twee de tijdlijn daadwerkelijk heeft gewijzigd. Een onlangs gedeeld project pakt deze exacte frictie aan door Claude Code te koppelen aan een stateful video-editing pipeline die wordt aangedreven door de Gemini Interactions API. Het resultaat is een werkende demonstratie van hoe je een AI-agent echt een creatieve workflow kunt laten regisseren, in plaats van deze alleen maar te laten suggereren.
Een regisseur en een editor
De architectuur is bewust gesplitst. Claude Code fungeert als de regisseur; het verzorgt de planning op hoog niveau, interpreteert vage creatieve briefings en beslist wat er hierna moet gebeuren. Het breekt een verzoek zoals “knip de stiltes weg en voeg een titelkaart toe” op in afzonderlijke taken en houdt vervolgens bij of elke taak slaagt voordat het verdergaat.
De Gemini Interactions API verzorgt de gespecialiseerde bewerkingslogica. In plaats van een generalistisch model te dwingen een video-editor te simuleren, gebruikt deze opzet de API van Google als de uitvoerende operator die knipsels maakt, de status van de tijdlijn evalueert en terugkoppelt met concrete resultaten. Het systeem combineert beide taken niet in één enkel model. Het houdt de redeneerlaag gescheiden van de tool-use-laag, wat betekent dat elk onderdeel zich kan concentreren op waar het het beste in is.
Deze verdeling weerspiegelt hoe echte postproductieteams werken. Een regisseur kent het verhaal en neemt de beslissingen. De editor kent de software en manipuleert de pixels. Wanneer een agent probeert beide taken binnen één contextvenster uit te voeren, struikelt hij vaak over de syntaxis of vergeet hij welke clip op welk spoor staat. Het splitsen van de werklast lost dit op.
Waarom geheugen alles verandert
Videobewerking is van nature stateful. Als je een clip met vier seconden inkort, moeten elke daaropvolgende overgang, audio-cue en ondertiteling verschuiven om overeen te komen. De meeste AI-agents hebben hier moeite mee omdat ze elke stap behandelen als een geïsoleerde query. Ze kunnen in de ene reactie een knip aanbevelen, om vervolgens in de volgende een andere tijdlijn te hallucineren, of een effect voorstellen voor een segment dat niet meer bestaat.
De Gemini Interactions API is gebouwd om de status te behouden tijdens deze operaties. Het houdt de werkelijke conditie van het project bij terwijl de agent werkt. Dat betekent dat het systeem weet of een export is mislukt, of een clip al is verwerkt, of dat er een kleurcorrectie is toegepast. Wanneer Claude de volgende instructie geeft, werkt het op basis van de werkelijke huidige status van de tijdlijn, niet op basis van een gok.
Voor iedereen die wel eens heeft gezien hoe een AI vol vertrouwen een "eenvoudige" oplossing in vijf stappen voorstelt die de voorgaande vier stappen volledig negeert, is de waarde van een persistente status overduidelijk. Creatieve taken verslechteren snel zonder geheugen. Een stateful backend verandert een chatbot in een deelnemer die daadwerkelijk een klus kan klaren.
Hoe de workflow eruitziet
Stel je een praktische reeks voor. Je voert het systeem verschillende ruwe clips en vraagt om een afgewerkte edit voor sociale media. Claude Code evalueert eerst het verzoek. Het kan besluiten dat de beelden stabilisatie nodig hebben, gevolgd door een voice-over extractie, ondertiteling en tot slot een verticale crop. Het structureert dit als een plan en begint de Gemini Interactions API aan te roepen om elk item in volgorde uit te voeren.
Gemini voert de media-operaties uit en geeft gestructureerde feedback terug. Misschien is de stabilisatie geslaagd, maar vond de audio-scheiding overlappende dialogen waardoor de ondertiteling onbetrouwbaar wordt. Claude ontvangt die update, herziet het plan en vraagt Gemini om een andere aanpak te proberen, zoals het identificeren van sprekerssegmenten voordat de tekstoverlays worden gegenereerd. Omdat de API de status vasthoudt, kan het bevestigen dat het ondertitelingstraject aansluit bij de nieuw gestabiliseerde video, en niet bij de oorspronkelijke trillende beelden.
Deze lus gaat door totdat de checklist volledig is. Het systeem creëert een echte workflow voor complexe videotaken in plaats van een eenmalige scriptgeneratie. Als een render mislukt omdat een codec-instelling incompatibel is, wordt de fout teruggekoppeld aan Claude, die parameters kan aanpassen en het opnieuw kan proberen. De agent geeft het project niet op na de eerste hindernis.
Verschillende modellen gebruiken voor verschillende sterktes
Het project illustreert ook een breder ontwerppatroon in AI-engineering: stop met proberen om één model alles te laten doen. Claude Code blinkt uit in het redeneren door ambigue instructies, het beheren van vertakkende logica en het behouden van de conversationele context tijdens een lange sessie. De Gemini Interactions API brengt, vooral in de interactie met rich media en het gebruik van tools, diepe multimodale mogelijkheden en stateful uitvoering met zich mee. Door ze aan elkaar te koppelen, omzeil je de beperkingen van elk afzonderlijk model.
Een redeneermodel dat nog nooit een non-lineaire editor heeft aangeraakt, kan nog steeds een geweldige montage regisseren als het toegang heeft tot een executielaag die codecs, keyframes en track-hiërarchieën begrijpt. Omgekeerd hoeft een media-ervaren API geen abstracte creatieve aantekeningen te analyseren als een planner-model deze al heeft vertaald naar concrete stappen. De sterktes van de één lossen de zwaktes van de ander op.
Dit is niet theoretisch. De opzet demonstreert expliciet hoe verschillende AI-modellen samenwerken om een categorie werk te verrichten — creatieve videobewerking — waar agents met slechts één model vaak niet aan toekomen. Voor ontwikkelaars die agentic systemen bouwen, is de les moeilijk te negeren. Stop met het vragen aan je orchestratielaag om je specialist te zijn, en stop met het vragen aan je specialist om je strateeg te zijn.
Wat bouwers moeten onthouden
Je hoeft geen videostudio te runnen om dit patroon nuttig te vinden. Elk domein dat stapsgewijs werk vereist in een veranderende omgeving — CAD-workflows, audio-engineering, datavisualisatie of wetenschappelijk rekenen — kan dezelfde structuur gebruiken. Eén model fungeert als de persistente projectmanager. Een gespecialiseerde API of tool handelt de stateful operaties af binnen de domeinspecifieke software.
De taak van de ontwikkelaar verschuift van het schrijven van gigantische prompts in de hoop dat het model alles onthoudt, naar het ontwerpen van heldere overdrachten tussen redeneren en uitvoering. State management wordt het cruciale onderdeel. Als je agent niet kan zien wat er is veranderd na zijn laatste actie, kan hij niet betrouwbaar opnieuw handelen.
Je kunt de volledige analyse van hoe de integratie werkt, inclusief de specifieke API-interacties en de projectstructuur, lezen in het gedetailleerde bericht op dev.to.
De belangrijkste les
Het oplossen van complex creatief werk met AI vereist niet het wachten op één enkel, perfect model dat alles tegelijk kan plannen, onthouden en uitvoeren. Het vereist dat je de agent een geheugen geeft dat de stappen overleeft en een specialist aan wie hij daadwerkelijk taken kan delegeren. Laat de denker denken. Laat de editor editen.
