La mayoría del software creativo todavía requiere que un humano se sitúe entre la idea y el archivo final. Podrías describir la edición de un vídeo a una IA, pero el trabajo real de recortar clips, ajustar capas y exportar fotogramas suele recaer en ti. Ese vacío existe porque la edición de medios no es una tarea única de "instrucción y respuesta". Es una larga cadena de decisiones dependientes donde el tercer paso solo tiene sentido si el segundo paso realmente cambió la línea de tiempo. Un proyecto compartido recientemente aborda precisamente esta fricción al conectar Claude Code en un flujo de trabajo de edición de vídeo con estado, impulsado por la Gemini Interactions API. El resultado es una demostración funcional de cómo lograr que un agente de IA dirija realmente un flujo de trabajo creativo en lugar de simplemente sugerir uno.

Un director y un editor

La arquitectura está dividida intencionadamente. Claude Code opera como el director, encargándose de la planificación de alto nivel, interpretando informes creativos vagos y decidiendo qué debe suceder a continuación. Desglosa una solicitud como "elimina los silencios y añade una tarjeta de título" en tareas discretas, y luego supervisa si cada tarea tiene éxito antes de continuar.

La Gemini Interactions API se encarga de la lógica de edición especializada. En lugar de obligar a un modelo generalista a simular a un editor de vídeo, esta configuración utiliza la API de Google como el operador práctico que ejecuta cortes, evalúa el estado de la línea de tiempo e informa con resultados concretos. El sistema no fusiona ambas funciones en un solo modelo. Mantiene la capa de razonamiento separada de la capa de uso de herramientas, lo que significa que cada parte puede centrarse en lo que mejor sabe hacer.

Esta división refleja cómo funcionan los equipos de postproducción reales. Un director conoce la historia y toma las decisiones. El editor conoce el software y manipula los píxeles. Cuando un agente intenta hacer ambas cosas dentro de una misma ventana de contexto, a menudo tropieza con la sintaxis o se olvida de qué clip está en qué pista. Dividir la carga soluciona ese problema.

Por qué la memoria lo cambia todo

La edición de vídeo es intrínsecamente dependiente del estado. Si acortas un clip cuatro segundos, cada transición, señal de audio y colocación de subtítulos posterior debe desplazarse para coincidir. La mayoría de los agentes de IA tienen dificultades aquí porque tratan cada paso como una consulta aislada. Podrían recomendar un corte en una respuesta y luego alucinar una línea de tiempo diferente en la siguiente, o sugerir un efecto para un segmento que ya no existe.

La Gemini Interactions API está diseñada para mantener el estado a través de estas operaciones. Realiza un seguimiento de la condición real del proyecto a medida que el agente trabaja. Eso significa que el sistema sabe si una exportación falló, si un clip ya ha sido procesado o si se ha aplicado una corrección de color. Cuando Claude emite la siguiente instrucción, está trabajando sobre el estado real actual de la línea de tiempo, no sobre una suposición.

Para cualquiera que haya visto a una IA sugerir con confianza una solución "sencilla" de cinco pasos que ignora por completo los cuatro pasos anteriores, el valor del estado persistente es obvio. Las tareas creativas se degradan rápidamente sin memoria. Un backend con estado convierte a un chatbot en un participante que realmente puede terminar un trabajo.

Cómo es el flujo de trabajo

Imagina una secuencia práctica. Introduces en el sistema varios clips brutos y pides un montaje final para redes sociales. Claude Code primero evalúa la solicitud. Podría decidir que el metraje necesita estabilización, luego una extracción de voz en off, luego subtítulos y después un recorte vertical. Estructura esto como un plan y comienza a llamar a la Gemini Interactions API para ejecutar cada elemento en orden.

Gemini realiza las operaciones de medios y devuelve comentarios estructurados. Quizás la estabilización tuvo éxito, pero la separación de audio encontró diálogos superpuestos que hacen que los subtítulos no sean fiables. Claude recibe esa actualización, revisa el plan y le pide a Gemini que intente un enfoque diferente, como identificar segmentos de hablantes antes de generar superposiciones de texto. Debido a que la API mantiene el estado, puede confirmar que la pista de subtítulos se alinea con el vídeo recién estabilizado, no con el metraje original tembloroso.

Este bucle continúa hasta que la lista de tareas se completa. El sistema crea un flujo de trabajo genuino para tareas de vídeo complejas en lugar de una simple generación de guiones de un solo uso. Si un renderizado falla porque un ajuste de códec es incompatible, el error se transmite a Claude, que puede ajustar los parámetros y reintentarlo. El agente no abandona el proyecto tras el primer obstáculo.

Uso de diferentes modelos para diferentes fortalezas

El proyecto también ilustra un patrón de diseño más amplio en la ingeniería de IA: deje de intentar que un solo modelo lo haga todo. Claude Code destaca al razonar a través de instrucciones ambiguas, gestionar la lógica de ramificación y mantener el contexto conversacional durante una sesión larga. La Gemini Interactions API, particularmente en su interacción con medios enriquecidos y el uso de herramientas, aporta capacidades multimodales profundas y una ejecución con estado. Al conectarlos, se sortean los límites de cada uno.

Un modelo de razonamiento que nunca ha tocado un editor no lineal aún puede dirigir un gran montaje si tiene acceso a una capa de ejecución que comprenda los códecs, los fotogramas clave y las jerarquías de pistas. Por el contrario, una API experta en medios no necesita analizar notas creativas abstractas si un modelo de planificación ya las ha traducido en pasos concretos. Las fortalezas de uno corrigen las debilidades del otro.

Esto no es teórico. La configuración demuestra explícitamente cómo diferentes modelos de IA trabajan juntos para manejar una categoría de trabajo, la edición creativa de video, que los agentes de un solo modelo a menudo no logran terminar. Para los desarrolladores que construyen sistemas agénticos, la lección es difícil de ignorar. Deje de pedirle a su capa de orquestación que sea su especialista, y deje de pedirle a su especialista que sea su estratega.

Lo que los desarrolladores deben aprender

No es necesario dirigir un estudio de video para encontrar útil este patrón. Cualquier dominio que requiera un trabajo de múltiples pasos en un entorno cambiante, como flujos de trabajo de CAD, ingeniería de audio, visualización de datos o computación científica, puede adoptar la misma estructura. Un modelo actúa como el gestor de proyectos persistente. Una API o herramienta especializada se encarga de las operaciones con estado dentro del software específico del dominio.

El trabajo del desarrollador cambia de escribir prompts gigantes rezando para que el modelo lo recuerde todo, a diseñar traspasos limpios entre el razonamiento y la ejecución. La gestión del estado se convierte en la pieza crítica. Si su agente no puede ver qué cambió después de su última acción, no podrá actuar de nuevo de manera fiable.

Puede leer el desglose completo de cómo funciona la integración, incluidas las interacciones específicas de la API y la estructura del proyecto, en la publicación detallada en dev.to.

La lección clave

Resolver trabajos creativos complejos con IA no requiere esperar a un único modelo perfecto que pueda planificar, recordar y ejecutar todo a la vez. Requiere darle al agente una memoria que sobreviva entre pasos y un especialista al que realmente pueda delegar. Deje que el pensador piense. Deje que el editor edite.