Większość kreatywnego oprogramowania wciąż wymaga obecności człowieka między pomysłem a gotowym plikiem. Możesz opisać edycję wideo sztucznej inteligencji, ale faktyczna praca polegająca na przycinaniu klipów, dostosowywaniu warstw i eksporcie klatek zazwyczaj spoczywa na Tobie. Ta luka istnieje, ponieważ edycja mediów nie jest pojedynczym zadaniem typu „prompt i odpowiedź”. To długi łańcuch zależnych od siebie decyzji, w którym trzeci krok ma sens tylko wtedy, gdy drugi krok faktycznie zmienił oś czasu. Niedawno udostępniony projekt rozwiązuje dokładnie ten problem, integrując Claude Code ze stanowym (stateful) potokiem edycji wideo opartym na Gemini Interactions API. Rezultatem jest działająca demonstracja tego, jak sprawić, by agent AI naprawdę kierował procesem twórczym, zamiast jedynie go sugerować.

Reżyser i montażysta

Architektura została celowo podzielona. Claude Code działa jako reżyser, zajmując się planowaniem na wysokim poziomie, interpretacją ogólnych briefów kreatywnych i decydowaniem o tym, co musi wydarzyć się dalej. Rozbija on prośbę typu „wytnij ciszę i dodaj planszę tytułową” na poszczególne zadania, a następnie monitoruje, czy każde z nich zakończyło się sukcesem, zanim przejdzie do kolejnego.

Gemini Interactions API obsługuje specjalistyczną logikę montażu. Zamiast zmuszać model ogólnego przeznaczenia do symulowania montażysty wideo, to rozwiązanie wykorzystuje API Google jako operatora wykonującego bezpośrednią pracę: wykonującego cięcia, oceniającego stan osi czasu i raportującego konkretne wyniki. System nie łączy obu tych ról w jednym modelu. Utrzymuje warstwę rozumowania oddzielnie od warstwy użycia narzędzi, co oznacza, że każda część może skupić się na tym, co robi najlepiej.

Ten podział odzwierciedla sposób działania rzeczywistych zespołów postprodukcyjnych. Reżyser zna historię i podejmuje decyzje. Montażysta zna oprogramowanie i manipuluje pikselami. Gdy agent próbuje robić obie te rzeczy w ramach jednego okna kontekstowego, często potyka się o składnię lub zapomina, który klip znajduje się na której ścieżce. Podział obciążenia rozwiązuje ten problem.

Dlaczego pamięć zmienia wszystko

Edycja wideo jest z natury stanowa (stateful). Jeśli skrócisz klip o cztery sekundy, każde kolejne przejście, sygnał dźwiękowy i umiejscowienie napisów musi ulec przesunięciu, aby zachować spójność. Większość agentów AI ma tutaj trudności, ponieważ traktują każdy krok jako odizolowane zapytanie. Mogą zarekomendować cięcie w jednej odpowiedzi, a w następnej wygenerować halucynację dotyczącą innej osi czasu lub zasugerować efekt dla segmentu, który już nie istnieje.

Gemini Interactions API zostało zbudowane tak, aby utrzymywać stan podczas tych operacji. Śledzi ono faktyczny stan projektu w miarę pracy agenta. Oznacza to, że system wie, czy eksport się nie powiódł, czy klip został już przetworzony lub czy zastosowano korekcję kolorów. Gdy Claude wydaje kolejną instrukcję, pracuje ona na podstawie rzeczywistego, aktualnego stanu osi czasu, a nie domysłów.

Dla każdego, kto widział, jak AI z pewnością siebie sugeruje „prostą”, pięcioetapową poprawkę, która całkowicie ignoruje poprzednie cztery kroki, wartość trwałego stanu jest oczywista. Zadania kreatywne szybko tracą na jakości bez pamięci. Stanowy backend zmienia czatbota w uczestnika, który potrafi faktycznie ukończyć zadanie.

Jak wygląda ten proces pracy

Wyobraź sobie praktyczną sekwencję. Wprowadzasz do systemu kilka surowych klipów i prosisz o gotowy montaż pod media społecznościowe. Claude Code najpierw ocenia prośbę. Może zdecydować, że materiał wymaga stabilizacji, następnie ekstrakcji lektora, potem napisów, a na końcu pionowego kadrowania. Strukturyzuje to jako plan i zaczyna wywoływać Gemini Interactions API, aby wykonać każdy element po kolei.

Gemini wykonuje operacje na mediach i zwraca ustrukturyzowaną informację zwrotną. Być może stabilizacja się powiodła, ale separacja dźwięku wykryła nakładające się dialogi, co sprawia, że napisy są mało wiarygodne. Claude otrzymuje tę aktualizację, poprawia plan i prosi Gemini o wypróbowanie innego podejścia, np. zidentyfikowanie segmentów mówców przed wygenerowaniem nakładek tekstowych. Ponieważ API utrzymuje stan, może ono potwierdzić, że ścieżka napisów jest zsynchronizowana z nowo ustabilizowanym wideo, a nie z oryginalnym, trzęsącym się materiałem.

Ta pętla trwa, dopóki lista kontrolna nie zostanie ukończona. System tworzy prawdziwy proces pracy dla złożonych zadań wideo, zamiast jednorazowego generowania skryptu. Jeśli renderowanie się nie powiedzie z powodu niekompatybilnych ustawień kodeka, błąd trafia z powrotem do Claude, który może dostosować parametry i spróbować ponownie. Agent nie porzuca projektu po pierwszej przeszkodzie.

Wykorzystanie różnych modeli o różnych mocnych stronach

Projekt ilustruje również szerszy wzorzec projektowy w inżynierii AI: przestań próbować sprawić, by jeden model robił wszystko. Claude Code doskonale radzi sobie z rozumowaniem na podstawie niejednoznacznych instrukcji, zarządzaniem logiką rozgałęzioną i utrzymywaniem kontekstu rozmowy podczas długich sesji. Gemini Interactions API, szczególnie w interakcji z multimediami i wykorzystaniu narzędzi, wnosi głębokie możliwości multimodalne i wykonywanie stanowe. Łącząc je ze sobą, omijasz ograniczenia każdego z nich.

Model rozumujący, który nigdy nie dotknął edytora nieliniowego, wciąż może wyreżyserować świetny montaż, jeśli ma dostęp do warstwy wykonawczej, która rozumie kodeki, klatki kluczowe i hierarchię ścieżek. I odwrotnie – API biegłe w mediach nie musi analizować abstrakcyjnych uwag kreatywnych, jeśli model planujący przetłumaczył je już na konkretne kroki. Mocne strony jednego niwelują słabości drugiego.

To nie jest teoria. To rozwiązanie wyraźnie pokazuje, jak różne modele AI współpracują, aby poradzić sobie z kategorią zadań – kreatywną edycją wideo – w której agenci oparci na pojedynczym modelu często zawodzą. Dla programistów budujących systemy agentowe lekcja ta jest trudna do zignorowania. Przestań wymagać od warstwy orkiestracji, by była Twoim specjalistą, i przestań wymagać od specjalisty, by był Twoim strategiem.

Co powinni wynieść twórcy

Nie musisz prowadzić studia wideo, aby uznać ten wzorzec za użyteczny. Każda dziedzina wymagająca wieloetapowej pracy w zmieniającym się środowisku – procesy CAD, inżynieria dźwięku, wizualizacja danych czy obliczenia naukowe – może zapożyczyć tę samą strukturę. Jeden model pełni rolę stałego menedżera projektu. Wyspecjalizowane API lub narzędzie obsługuje operacje stanowe wewnątrz oprogramowania specyficznego dla danej dziedziny.

Zadanie programisty przesuwa się z pisania gigantycznych promptów z nadzieją, że model zapamięta wszystko, na projektowanie czystych przekazań zadań między rozumowaniem a wykonaniem. Zarządzanie stanem staje się kluczowym elementem. Jeśli Twój agent nie widzi, co zmieniło się po jego ostatnim działaniu, nie może on ponownie działać w sposób niezawodny.

Pełną analizę działania integracji, w tym konkretne interakcje z API i strukturę projektu, można przeczytać w szczegółowym wpisie na dev.to.

Kluczowy wniosek

Rozwiązywanie złożonych zadań kreatywnych za pomocą AI nie wymaga czekania na pojedynczy, idealny model, który potrafi planować, pamiętać i wykonywać wszystko naraz. Wymaga ono wyposażenia agenta w pamięć, która przetrwa między krokami, oraz w specjalistę, któremu może on faktycznie delegować zadania. Pozwól myślicielowi myśleć. Pozwól montażyście montować.