Большинство творческих программ по-прежнему предполагают, что между идеей и готовым файлом должен находиться человек. Вы можете описать задачу по монтажу видео ИИ, но фактическая работа по обрезке клипов, настройке слоев и экспорту кадров обычно ложится на ваши плечи. Этот разрыв существует потому, что монтаж медиафайлов — это не просто задача в формате «запрос-ответ». Это длинная цепочка взаимозависимых решений, где третий шаг имеет смысл только в том случае, если второй шаг действительно изменил таймлайн. Недавно представленный проект решает именно эту проблему, интегрируя Claude Code в систему управления видеомонтажом с сохранением состояния (stateful video editing pipeline), работающую на базе Gemini Interactions API. Результатом стала рабочая демонстрация того, как заставить ИИ-агента по-настоящему управлять творческим процессом, а не просто предлагать варианты.

Режиссер и монтажер

Архитектура намеренно разделена. Claude Code выступает в роли режиссера: он занимается высокоуровневым планированием, интерпретирует расплывчатые творческие брифы и решает, что нужно делать дальше. Он разбивает запрос вроде «убери паузы и добавь титр» на отдельные задачи, а затем отслеживает выполнение каждой из них, прежде чем двигаться дальше.

Gemini Interactions API берет на себя специализированную логику монтажа. Вместо того чтобы заставлять универсальную модель имитировать видеомонтажера, эта схема использует API от Google в качестве исполнителя, который выполняет склейки, оценивает состояние таймлайна и сообщает о конкретных результатах. Система не объединяет обе роли в одну модель. Она отделяет уровень рассуждений от уровня использования инструментов, что позволяет каждой части сосредоточиться на том, что она делает лучше всего.

Такое разделение отражает работу реальных команд постпродакшена. Режиссер знает историю и принимает решения. Монтажер знает софт и манипулирует пикселями. Когда агент пытается делать и то, и другое в рамках одного контекстного окна, он часто спотыкается о синтаксис или забывает, какой клип находится на какой дорожке. Разделение нагрузки решает эту проблему.

Почему память меняет всё

Видеомонтаж по своей природе является процессом с сохранением состояния (stateful). Если вы сокращаете клип на четыре секунды, каждый последующий переход, звуковой сигнал и расположение субтитров должны сместиться соответствующим образом. Большинство ИИ-агентов испытывают здесь трудности, потому что рассматривают каждый шаг как изолированный запрос. Они могут порекомендовать склейку в одном ответе, а в следующем — «галлюцинировать» уже другой таймлайн или предложить эффект для сегмента, которого больше не существует.

Gemini Interactions API создан для поддержания состояния на протяжении всех этих операций. Он отслеживает реальное состояние проекта по мере работы агента. Это означает, что система знает, не произошел ли сбой экспорта, был ли уже обработан клип или применена ли цветокоррекция. Когда Claude выдает следующую инструкцию, он опирается на реальное текущее состояние таймлайна, а не на предположения.

Для любого, кто видел, как ИИ уверенно предлагает «простое» решение из пяти шагов, полностью игнорируя предыдущие четыре, ценность постоянного состояния очевидна. Без памяти творческие задачи быстро деградируют. Бэкенд с сохранением состояния превращает чат-бота в полноценного участника процесса, способного довести работу до конца.

Как выглядит рабочий процесс

Представьте практическую последовательность действий. Вы подаете системе несколько необработанных клипов и просите сделать готовый монтаж для соцсетей. Сначала Claude Code оценивает запрос. Он может решить, что видео нужно стабилизировать, затем извлечь закадровый голос, затем добавить субтитры, а затем сделать вертикальную обрезку. Он структурирует это в виде плана и начинает вызывать Gemini Interactions API для последовательного выполнения каждого пункта.

Gemini выполняет операции с медиафайлами и возвращает структурированную обратную связь. Возможно, стабилизация прошла успешно, но при разделении аудио обнаружились перекрывающиеся диалоги, из-за чего субтитры стали ненадежными. Claude получает это обновление, пересматривает план и просит Gemini попробовать другой подход, например, сначала идентифицировать сегменты говорящих, а затем генерировать текстовые наложения. Поскольку API сохраняет состояние, он может подтвердить, что дорожка субтитров совпадает с новым стабилизированным видео, а не с исходным дрожащим материалом.

Этот цикл продолжается до тех пор, пока список задач не будет выполнен. Система создает настоящий рабочий процесс для сложных видеозадач, а не просто генерирует разовый скрипт. Если рендеринг не удался из-за несовместимости настроек кодека, ошибка передается обратно Claude, который может скорректировать параметры и повторить попытку. Агент не бросает проект после первого же препятствия.

Использование разных моделей для разных задач

Проект также иллюстрирует более широкий паттерн проектирования в области AI-инженерии: перестаньте пытаться заставить одну модель делать всё. Claude Code отлично справляется с рассуждениями при получении неоднозначных инструкций, управлением разветвленной логикой и поддержанием контекста беседы в течение длительной сессии. Gemini Interactions API, особенно в части взаимодействия с мультимедиа и использования инструментов, обеспечивает глубокие мультимодальные возможности и выполнение с сохранением состояния (stateful execution). Связывая их вместе, вы обходите ограничения каждого из них.

Модель рассуждения, которая никогда не касалась нелинейного редактора, все равно может руководить отличным монтажом, если у нее есть доступ к уровню исполнения, который понимает кодеки, ключевые кадры и иерархию дорожек. И наоборот, специализированному медиа-API не нужно анализировать абстрактные творческие заметки, если модель-планировщик уже перевела их в конкретные шаги. Сильные стороны одного компенсируют недостатки другого.

Это не теория. Данная конфигурация наглядно демонстрирует, как различные модели ИИ работают вместе над категорией задач — творческим видеомонтажом, — с которой агенты на базе одной модели часто не справляются. Разработчикам, создающим агентные системы, этот урок трудно игнорировать. Перестаньте требовать от своего уровня оркестрации быть специалистом, и перестаньте требовать от своего специалиста быть стратегом.

Что стоит извлечь разработчикам

Вам не нужно управлять видеостудией, чтобы найти этот паттерн полезным. Любая область, требующая многоэтапной работы в изменяющейся среде — будь то рабочие процессы CAD, аудиоинженерия, визуализация данных или научные вычисления — может использовать ту же структуру. Одна модель выступает в роли постоянного менеджера проекта. Специализированный API или инструмент берет на себя операции с сохранением состояния внутри профильного программного обеспечения.

Задача разработчика смещается от написания гигантских промптов в надежде, что модель всё запомнит, к проектированию четкой передачи задач между этапами рассуждения и исполнения. Управление состоянием становится критически важным элементом. Если ваш агент не видит, что изменилось после его последнего действия, он не сможет надежно действовать снова.

Полный разбор того, как работает интеграция, включая специфику взаимодействия через API и структуру проекта, можно прочитать в подробном посте на dev.to.

Главный вывод

Решение сложных творческих задач с помощью ИИ не требует ожидания появления одной идеальной модели, способной планировать, помнить и исполнять всё одновременно. Оно требует предоставления агенту памяти, сохраняющейся между шагами, и специалиста, которому он сможет реально делегировать задачи. Дайте мыслителю мыслить. Дайте монтажеру монтировать.