Die meisten kreativen Softwares erwarten immer noch, dass ein Mensch zwischen der Idee und der fertigen Datei steht. Man kann einer KI zwar einen Videoschnitt beschreiben, aber die eigentliche Arbeit – das Kürzen von Clips, das Anpassen von Ebenen und das Exportieren von Frames – bleibt meistens am Menschen hängen. Diese Lücke besteht, weil die Medienbearbeitung keine einfache Prompt-Response-Aufgabe ist. Es ist eine lange Kette abhängiger Entscheidungen, bei der Schritt drei nur dann Sinn ergibt, wenn Schritt zwei tatsächlich die Timeline verändert hat. Ein kürzlich vorgestelltes Projekt geht genau dieser Reibung entgegen, indem es Claude Code in eine zustandsbehaftete (stateful) Videobearbeitungs-Pipeline integriert, die von der Gemini Interactions API angetrieben wird. Das Ergebnis ist eine funktionierende Demonstration davon, wie man einen KI-Agenten dazu bringt, einen kreativen Workflow tatsächlich zu steuern, anstatt ihn nur vorzuschlagen.
Ein Regisseur und ein Editor
Die Architektur ist bewusst aufgeteilt. Claude Code agiert als Regisseur, übernimmt die übergeordnete Planung, interpretiert vage kreative Briefings und entscheidet, was als Nächstes zu tun ist. Es zerlegt eine Anfrage wie „schneide die Pausen heraus und füge eine Titelseite hinzu“ in einzelne Aufgaben und überwacht dann, ob jede Aufgabe erfolgreich war, bevor es fortfährt.
Die Gemini Interactions API übernimmt die spezialisierte Bearbeitungslogik. Anstatt ein Generalisten-Modell dazu zu zwingen, einen Videoeditor zu simulieren, nutzt dieses Setup Googles API als ausführenden Operator, der Schnitte vornimmt, den Zustand der Timeline bewertet und konkrete Ergebnisse zurückmeldet. Das System verschmilzt beide Aufgaben nicht zu einem einzigen Modell. Es hält die Reasoning-Ebene getrennt von der Tool-Use-Ebene, was bedeutet, dass sich jeder Teil auf das konzentrieren kann, was er am besten kann.
Diese Aufteilung spiegelt die Arbeitsweise echter Postproduktions-Teams wider. Ein Regisseur kennt die Geschichte und trifft die Entscheidungen. Der Editor kennt die Software und manipuliert die Pixel. Wenn ein Agent versucht, beides innerhalb eines einzigen Kontextfensters zu erledigen, stolpert er oft über die Syntax oder vergisst, welcher Clip auf welchem Track liegt. Die Lastverteilung löst dieses Problem.
Warum Gedächtnis alles verändert
Videobearbeitung ist von Natur aus zustandsbehaftet (stateful). Wenn man einen Clip um vier Sekunden kürzt, müssen alle nachfolgenden Übergänge, Audio-Signale und Untertitel-Platzierungen entsprechend verschoben werden. Die meisten KI-Agenten haben hier Schwierigkeiten, weil sie jeden Schritt als isolierte Abfrage behandeln. Sie schlagen vielleicht in einer Antwort einen Schnitt vor, halluzinieren dann in der nächsten eine andere Timeline oder schlagen einen Effekt für ein Segment vor, das gar nicht mehr existiert.
Die Gemini Interactions API ist darauf ausgelegt, den Zustand über diese Operationen hinweg beizubehalten. Sie verfolgt den tatsächlichen Zustand des Projekts, während der Agent arbeitet. Das bedeutet, das System weiß, ob ein Export fehlgeschlagen ist, ob ein Clip bereits bearbeitet wurde oder ob ein Color Grading angewendet wurde. Wenn Claude die nächste Anweisung gibt, arbeitet es auf Basis des tatsächlichen aktuellen Zustands der Timeline und nicht auf Basis einer Vermutung.
Für jeden, der schon einmal erlebt hat, wie eine KI selbstbewusst eine „einfache“ fünfstufige Lösung vorschlägt, die die vorherigen vier Schritte komplett ignoriert, ist der Wert eines persistenten Zustands offensichtlich. Kreative Aufgaben verlieren ohne Gedächtnis schnell an Qualität. Ein zustandsbehaftetes Backend macht aus einem Chatbot einen Teilnehmer, der eine Aufgabe tatsächlich abschließen kann.
So sieht der Workflow aus
Stellen Sie sich eine praktische Abfolge vor. Sie füttern das System mit mehreren Rohclips und bitten um einen fertigen Social-Media-Schnitt. Claude Code bewertet zunächst die Anfrage. Es könnte entscheiden, dass das Material stabilisiert werden muss, dann eine Voice-over-Extraktion, dann Untertitel und schließlich ein vertikaler Zuschnitt. Es strukturiert dies als Plan und beginnt, die Gemini Interactions API aufzurufen, um jeden Punkt nacheinander auszuführen.
Gemini führt die Medienoperationen aus und liefert strukturiertes Feedback zurück. Vielleicht war die Stabilisierung erfolgreich, aber die Audiotrennung hat überlappende Dialoge gefunden, die die Untertitel unzuverlässig machen. Claude erhält dieses Update, überarbeitet den Plan und bittet Gemini, einen anderen Ansatz zu versuchen, wie etwa die Identifizierung von Sprechersegmenten, bevor Text-Overlays generiert werden. Da die API den Zustand hält, kann sie bestätigen, dass die Untertitelspur mit dem neu stabilisierten Video übereinstimmt und nicht mit dem ursprünglichen, wackeligen Material.
Diese Schleife setzt sich fort, bis die Checkliste abgearbeitet ist. Das System schafft einen echten Workflow für komplexe Videoaufgaben anstelle einer einmaligen Skriptgenerierung. Wenn ein Rendering fehlschlägt, weil eine Codec-Einstellung inkompatibel ist, wird der Fehler an Claude zurückgemeldet, der die Parameter anpassen und es erneut versuchen kann. Der Agent gibt das Projekt nicht nach der ersten Hürde auf.
Unterschiedliche Modelle für unterschiedliche Stärken
Das Projekt veranschaulicht zudem ein breiteres Designmuster im AI-Engineering: Hören Sie auf zu versuchen, ein einziges Modell alles machen zu lassen. Claude Code glänzt beim Schlussfolgern durch mehrdeutige Anweisungen, beim Verwalten von Verzweigungslogik und beim Beibehalten des Gesprächskontexts über eine lange Sitzung hinweg. Die Gemini Interactions API bringt, insbesondere in ihrer Interaktion mit Rich Media und der Tool-Nutzung, tiefgreifende multimodale Fähigkeiten und zustandsbehaftete Ausführung mit sich. Indem man sie miteinander verknüpft, umgeht man die jeweiligen Grenzen.
Ein Reasoning-Modell, das noch nie einen nichtlinearen Editor angefasst hat, kann dennoch einen großartigen Schnitt anleiten, wenn es Zugriff auf eine Ausführungsschicht hat, die Codecs, Keyframes und Spurhierarchien versteht. Umgekehrt muss eine medienaffine API keine abstrakten kreativen Notizen parsen, wenn ein Planungsmodell diese bereits in konkrete Schritte übersetzt hat. Die Stärken des einen beheben die Schwächen des anderen.
Das ist nicht theoretisch. Der Aufbau zeigt explizit, wie verschiedene KI-Modelle zusammenarbeiten, um eine Arbeitskategorie zu bewältigen – kreativen Videoschnitt –, an der Single-Model-Agenten oft scheitern. Für Entwickler, die agentische Systeme bauen, ist die Lehre schwer zu ignorieren: Hören Sie auf, von Ihrer Orchestrierungsschicht zu verlangen, Ihr Spezialist zu sein, und hören Sie auf, von Ihrem Spezialisten zu verlangen, Ihr Stratege zu sein.
Was Entwickler daraus lernen sollten
Man muss kein Videostudio führen, um dieses Muster nützlich zu finden. Jeder Bereich, der mehrstufige Arbeit in einer sich verändernden Umgebung erfordert – CAD-Workflows, Audio-Engineering, Datenvisualisierung oder wissenschaftliches Rechnen –, kann dieselbe Struktur übernehmen. Ein Modell fungiert als beständiger Projektmanager. Eine spezialisierte API oder ein Tool übernimmt die zustandsbehafteten Operationen innerhalb der domänenspezifischen Software.
Die Aufgabe des Entwicklers verschiebt sich vom Schreiben riesiger Prompts, in der Hoffnung, dass das Modell sich an alles erinnert, hin zum Entwurf sauberer Übergaben zwischen Reasoning und Ausführung. Das State-Management wird zum entscheidenden Element. Wenn Ihr Agent nicht sehen kann, was sich nach seiner letzten Aktion geändert hat, kann er nicht zuverlässig erneut handeln.
Die vollständige Analyse, wie die Integration funktioniert, einschließlich der spezifischen API-Interaktionen und der Projektstruktur, finden Sie im ausführlichen Beitrag auf dev.to.
Das eigentliche Fazit
Komplexe kreative Arbeit mit KI zu lösen, erfordert nicht das Warten auf ein einziges, perfektes Modell, das alles gleichzeitig planen, erinnern und ausführen kann. Es erfordert, dem Agenten ein Gedächtnis zu geben, das über die einzelnen Schritte hinweg Bestand hat, und einen Spezialisten, an den er tatsächlich delegieren kann. Lassen Sie den Denker denken. Lassen Sie den Editor schneiden.
