대부분의 창의적인 소프트웨어는 여전히 아이디어와 완성된 파일 사이에 사람이 개입하기를 기대합니다. AI에게 영상 편집을 설명할 수는 있지만, 클립을 다듬고, 레이어를 조정하고, 프레임을 내보내는 실제 작업은 대개 사람의 몫으로 남습니다. 이러한 간극이 존재하는 이유는 미디어 편집이 단일 프롬프트-응답 작업이 아니기 때문입니다. 편집은 단계 2가 타임라인을 실제로 변경했을 때만 단계 3이 의미를 갖는, 일련의 의존적인 결정들이 이어지는 긴 체인입니다. 최근 공유된 프로젝트는 Claude Code를 Gemini Interactions API 기반의 상태 유지(stateful) 영상 편집 파이프라인에 연결함으로써 바로 이 마찰 문제를 해결합니다. 그 결과는 AI 에이전트가 단순히 워크플로우를 제안하는 수준을 넘어, 창의적인 워크플로우를 실제로 지휘하도록 만드는 작동 가능한 데모를 보여줍니다.

감독과 편집자

아키텍처는 의도적으로 분리되어 있습니다. Claude Code는 감독 역할을 수행하며, 고수준의 계획을 세우고, 모호한 크리에이티브 브리프를 해석하며, 다음에 무엇을 해야 할지 결정합니다. "데드 에어(dead air)를 잘라내고 타이틀 카드를 추가해줘"와 같은 요청을 개별 작업으로 나누고, 다음 단계로 넘어가기 전에 각 작업이 성공했는지 모니터링합니다.

Gemini Interactions API는 전문적인 편집 로직을 담당합니다. 범용 모델에게 영상 편집자를 흉내 내라고 강요하는 대신, 이 설정에서는 Google의 API를 컷을 실행하고, 타임라인 상태를 평가하며, 구체적인 결과와 함께 보고하는 실무 운영자로 사용합니다. 이 시스템은 두 가지 작업을 하나의 모델로 통합하지 않습니다. 추론 레이어(reasoning layer)와 도구 사용 레이어(tool-use layer)를 분리하여 유지함으로써, 각 부분이 자신이 가장 잘하는 일에 집중할 수 있도록 합니다.

이러한 분리는 실제 포스트 프로덕션 팀이 작동하는 방식과 유사합니다. 감독은 스토리를 알고 결정을 내립니다. 편집자는 소프트웨어를 알고 픽셀을 조작합니다. 에이전트가 하나의 컨텍스트 윈도우 안에서 이 두 가지를 모두 수행하려고 하면, 구문 오류를 범하거나 어떤 클립이 어떤 트랙에 있는지 잊어버리는 경우가 많습니다. 부하를 분산하면 이 문제를 해결할 수 있습니다.

메모리가 모든 것을 바꾸는 이유

영상 편집은 본질적으로 상태 유지(stateful) 방식입니다. 클립의 길이를 4초 줄이면, 이후의 모든 전환, 오디오 큐, 자막 위치가 그에 맞춰 이동해야 합니다. 대부분의 AI 에이전트는 각 단계를 고립된 쿼리로 취급하기 때문에 여기서 어려움을 겪습니다. 한 응답에서는 컷을 추천했다가, 다음 응답에서는 다른 타임라인을 환각(hallucinate)하거나, 이미 존재하지 않는 세그먼트에 효과를 제안할 수도 있습니다.

Gemini Interactions API는 이러한 작업 전반에 걸쳐 상태를 유지하도록 설계되었습니다. 에이전트가 작업하는 동안 프로젝트의 실제 상태를 추적합니다. 즉, 시스템은 내보내기가 실패했는지, 클립이 이미 처리되었는지, 또는 컬러 그레이딩이 적용되었는지 여부를 알 수 있습니다. Claude가 다음 지침을 내릴 때, 그것은 추측이 아니라 타임라인의 실제 현재 상태를 바탕으로 작동합니다.

AI가 이전의 네 단계를 완전히 무시한 채 "간단한" 5단계 해결책을 자신 있게 제안하는 것을 본 적이 있는 사람이라면, 지속적인 상태(persistent state)의 가치는 명확합니다. 창의적인 작업은 메모리 없이는 빠르게 품질이 저하됩니다. 상태 유지형 백엔드는 챗봇을 실제로 작업을 완수할 수 있는 참여자로 탈바꿈시킵니다.

워크플로우의 모습

실질적인 시퀀스를 상상해 보세요. 시스템에 여러 개의 원본 클립을 입력하고 완성된 소셜 미디어용 편집본을 요청합니다. Claude Code는 먼저 요청을 평가합니다. 영상에 스테빌라이제이션(stabilization)이 필요하다고 판단한 뒤, 음성 추출, 자막 추가, 세로 크롭 순으로 계획을 세울 수 있습니다. 이를 계획으로 구조화하고 Gemini Interactions API를 호출하여 각 항목을 순서대로 실행하기 시작합니다.

Gemini는 미디어 작업을 수행하고 구조화된 피드백을 반환합니다. 스테빌라이제이션은 성공했지만, 오디오 분리 과정에서 대사가 겹쳐 자막을 신뢰할 수 없다는 결과가 나올 수도 있습니다. Claude는 해당 업데이트를 받고 계획을 수정하여, 텍스트 오버레이를 생성하기 전에 화자 세그먼트를 식별하는 것과 같이 Gemini에게 다른 접근 방식을 시도하도록 요청합니다. API가 상태를 유지하고 있기 때문에, 자막 트랙이 원본의 흔들리는 영상이 아니라 새로 스테빌라이제이션된 영상과 일치하는지 확인할 수 있습니다.

이 루프는 체크리스트가 완료될 때까지 계속됩니다. 시스템은 일회성 스크립트 생성이 아닌, 복잡한 영상 작업을 위한 진정한 워크플로우를 생성합니다. 코덱 설정이 호환되지 않아 렌더링이 실패하면, 오류가 Claude에게 전달되어 매개변수를 조정하고 다시 시도할 수 있습니다. 에이전트는 첫 번째 장애물에 부딪혔다고 해서 프로젝트를 포기하지 않습니다.

각기 다른 강점을 가진 모델 활용하기

이 프로젝트는 AI 엔지니어링의 더 넓은 디자인 패턴을 보여줍니다. 즉, 하나의 모델이 모든 것을 다 하게 만들려는 시도를 멈추라는 것입니다. Claude Code는 모호한 지침을 추론하고, 분기 로직을 관리하며, 긴 세션 동안 대화 문맥을 유지하는 데 탁월합니다. Gemini Interactions API는 특히 풍부한 미디어와의 상호작용 및 도구 사용 측면에서 깊이 있는 멀티모달 기능과 상태 유지 실행(stateful execution) 능력을 제공합니다. 이 둘을 서로 연결함으로써, 각 모델의 한계를 우회할 수 있습니다.

비선형 편집기를 다뤄본 적 없는 추론 모델이라도 코덱, 키프레임, 트랙 계층 구조를 이해하는 실행 레이어에 접근할 수 있다면 훌륭한 컷을 디렉팅할 수 있습니다. 반대로, 플래너 모델이 추상적인 창의적 노트를 구체적인 단계로 이미 변환해 놓았다면, 미디어에 능숙한 API가 굳이 이를 해석할 필요는 없습니다. 한쪽의 강점이 다른 쪽의 약점을 보완하는 것입니다.

이것은 이론적인 이야기가 아닙니다. 이 설정은 단일 모델 에이전트가 종종 완수하지 못하는 작업 범주인 '창의적인 영상 편집'을 처리하기 위해 서로 다른 AI 모델들이 어떻게 협력하는지를 명확하게 보여줍니다. 에이전트 시스템을 구축하는 개발자들에게 이 교훈은 결코 간과할 수 없는 것입니다. 오케스트레이션 레이어에 전문가가 되어달라고 요구하지 말고, 전문가에게 전략가가 되어달라고 요구하지 마십시오.

빌더들이 얻어야 할 교훈

이 패턴이 유용하다는 것을 깨닫기 위해 반드시 영상 스튜디오를 운영할 필요는 없습니다. 변화하는 환경에서 다단계 작업이 필요한 모든 도메인, 즉 CAD 워크플로우, 오디오 엔지니어링, 데이터 시각화 또는 과학 계산 분야에서도 동일한 구조를 차용할 수 있습니다. 하나의 모델은 지속적인 프로젝트 매니저 역할을 수행하고, 특화된 API나 도구가 도메인 특화 소프트웨어 내부의 상태 유지 작업을 처리합니다.

개발자의 역할은 모델이 모든 것을 기억하기를 기도하며 거대한 프롬프트를 작성하는 것에서, 추론과 실행 사이의 깔끔한 핸드오프(handoff)를 설계하는 것으로 전환됩니다. 상태 관리(State management)가 핵심 요소가 됩니다. 만약 에이전트가 마지막 작업 이후 무엇이 변했는지 알 수 없다면, 다시 신뢰할 수 있는 동작을 수행할 수 없습니다.

구체적인 API 상호작용과 프로젝트 구조를 포함하여 통합 방식이 어떻게 작동하는지에 대한 전체 분석은 dev.to의 상세 포스트에서 확인할 수 있습니다.

핵심 요약

AI로 복잡한 창의적 작업을 해결하기 위해 계획, 기억, 실행을 한 번에 모두 수행할 수 있는 단 하나의 완벽한 모델이 나타나기를 기다릴 필요는 없습니다. 대신 에이전트에게 단계 사이에서도 유지되는 메모리를 제공하고, 실제로 업무를 위임할 수 있는 전문가를 붙여주는 것이 필요합니다. 생각하는 자는 생각하게 하고, 편집하는 자는 편집하게 하십시오.