बहुतेक सर्जनशील सॉफ्टवेअरमध्ये कल्पना आणि तयार फाईल यांच्यामध्ये मानवाचा हस्तक्षेप आवश्यक असतो. तुम्ही AI ला व्हिडिओ एडिटिंगचे वर्णन करू शकता, परंतु क्लिप्स ट्रिम करणे, लेयर्स ॲडजस्ट करणे आणि फ्रेम्स एक्सपोर्ट करणे ही प्रत्यक्ष कामे सहसा तुम्हालाच करावी लागतात. हे अंतर निर्माण होते कारण मीडिया एडिटिंग हे केवळ 'प्रॉम्प्ट आणि रिस्पॉन्स' (prompt-and-response) चे काम नाही. हे एकमेकांवर अवलंबून असलेल्या निर्णयांची एक लांब साखळी आहे, जिथे तिसरे पाऊल तेव्हाच अर्थपूर्ण ठरते जेव्हा दुसरे पाऊल टाइमलाइनमध्ये प्रत्यक्षात बदल करते. अलीकडे शेअर करण्यात आलेल्या एका प्रोजेक्टमध्ये Claude Code ला Gemini Interactions API द्वारे चालवल्या जाणाऱ्या 'स्टेटफुल' (stateful) व्हिडिओ एडिटिंग पाइपलाइनमध्ये जोडून या अडथळ्यावर मात करण्याचा प्रयत्न केला आहे. याचा परिणाम म्हणजे, AI एजंटला केवळ सूचना देण्याऐवजी सर्जनशील वर्कफ्लो खऱ्या अर्थाने निर्देशित करण्यासाठी कसा वापरता येईल, याचे एक कार्यरत प्रदर्शन समोर आले आहे.
एक दिग्दर्शक आणि एक संपादक
याची रचना जाणीवपूर्वक विभागलेली आहे. Claude Code दिग्दर्शकाच्या (director) भूमिकेत काम करते, जे उच्च-स्तरीय नियोजन हाताळते, अस्पष्ट सर्जनशील सूचनांचा अर्थ लावते आणि पुढे काय करायचे हे ठरवते. ते “डेड एअर (dead air) कापून टायटल कार्ड जोडा” सारख्या विनंतीचे लहान लहान कामांमध्ये विभाजन करते आणि त्यानंतर प्रत्येक काम यशस्वी होते की नाही यावर लक्ष ठेवते.
Gemini Interactions API विशेष एडिटिंग लॉजिक हाताळते. एखाद्या सामान्य मॉडेलला व्हिडिओ एडिटरप्रमाणे काम करण्यास भाग पाडण्याऐवजी, ही रचना Google च्या API चा वापर प्रत्यक्ष ऑपरेटर म्हणून करते, जो कट्स (cuts) कार्यान्वित करतो, टाइमलाइनची स्थिती तपासतो आणि ठोस निकालांसह माहिती देतो. ही प्रणाली दोन्ही कामे एकाच मॉडेलमध्ये एकत्रित करत नाही. ती 'रीझनिंग लेयर' (reasoning layer) आणि 'टूल-युज लेयर' (tool-use layer) वेगळे ठेवते, ज्याचा अर्थ असा की प्रत्येक भाग आपल्या सर्वोत्तम कौशल्यावर लक्ष केंद्रित करू शकतो.
हे विभाजन प्रत्यक्ष पोस्ट-प्रोडक्शन टीम्स कशा प्रकारे काम करतात याचे प्रतिबिंब आहे. दिग्दर्शकाला कथा माहित असते आणि तो निर्णय घेतो. संपादक सॉफ्टवेअर जाणतो आणि पिक्सेलवर प्रक्रिया करतो. जेव्हा एखादा एजंट एकाच कॉन्टेक्स्ट विंडोमध्ये दोन्ही कामे करण्याचा प्रयत्न करतो, तेव्हा तो अनेकदा सिंटॅक्समध्ये अडखळतो किंवा कोणता क्लिप कोणत्या ट्रॅकवर आहे हे विसरतो. कामाचे हे विभाजन केल्यामुळे ही समस्या सुटते.
मेमरीमुळे सर्व काही कसे बदलते
व्हिडिओ एडिटिंग हे मुळात 'स्टेटफुल' (stateful) असते. जर तुम्ही एखादी क्लिप चार सेकंद कमी केली, तर त्यानंतरचे प्रत्येक ट्रान्झिशन, ऑडिओ क्यू आणि सबटायटल प्लेसमेंट त्याप्रमाणे बदलणे आवश्यक असते. बहुतेक AI एजंट्सना येथे अडचण येते कारण ते प्रत्येक पायरीला एक स्वतंत्र क्वेरी मानतात. ते एका प्रतिसादात कट सुचवू शकतात, परंतु पुढच्या प्रतिसादात वेगळी टाइमलाइन कल्पनेत आणू शकतात (hallucinate), किंवा अशा सेगमेंटसाठी इफेक्ट सुचवू शकतात जो आता अस्तित्वातच नाही.
Gemini Interactions API या सर्व ऑपरेशन्समध्ये 'स्टेट' (state) टिकवून ठेवण्यासाठी बनवण्यात आले आहे. एजंट काम करत असताना ते प्रोजेक्टची प्रत्यक्ष स्थिती ट्रॅक करते. याचा अर्थ असा की एक्सपोर्ट अयशस्वी झाले आहे का, एखादी क्लिप आधीच प्रोसेस झाली आहे का, किंवा कलर ग्रेडिंग लागू केले आहे का, हे सिस्टमला माहित असते. जेव्हा Claude पुढची सूचना देते, तेव्हा ती केवळ अंदाज न लावता टाइमलाइनच्या वास्तविक सध्याच्या स्थितीवर आधारित काम करते.
ज्यांनी कधीही AI ला आत्मविश्वासाने पाच-पायांची "सोपी" सुधारणा सुचवताना पाहिले आहे, जी मागील चार पायऱ्या पूर्णपणे दुर्लक्षित करते, त्यांच्यासाठी 'पर्सिस्टंट स्टेट'चे (persistent state) महत्त्व स्पष्ट आहे. मेमरीशिवाय सर्जनशील कामे वेगाने बिघडतात. एक 'स्टेटफुल बॅकएंड' चॅटबॉटला अशा सहभागीमध्ये रूपांतरित करते जो प्रत्यक्षात काम पूर्ण करू शकतो.
वर्कफ्लो कसा दिसतो
एका व्यावहारिक क्रमाची कल्पना करा. तुम्ही सिस्टमला काही रॉ क्लिप्स देता आणि सोशल मीडियासाठी तयार व्हिडिओ हवा अशी विनंती करता. Claude Code प्रथम विनंतीचे मूल्यमापन करते. त्याला असे वाटू शकते की फुटेजला स्टेबिलायझेशनची गरज आहे, त्यानंतर व्हॉइस-ओव्हर एक्स्ट्रॅक्शन, त्यानंतर सबटायटल्स आणि शेवटी व्हर्टिकल क्रॉप. ते या गोष्टींचे नियोजन करते आणि प्रत्येक गोष्ट क्रमाने पूर्ण करण्यासाठी Gemini Interactions API ला कॉल करण्यास सुरुवात करते.
Gemini मीडिया ऑपरेशन्स करते आणि स्ट्रक्चर्ड फीडबॅक परत देते. कदाचित स्टेबिलायझेशन यशस्वी झाले असेल, परंतु ऑडिओ सेपरेशनमध्ये संवाद एकमेकांवर ओव्हरलॅप होत असल्याचे आढळले ज्यामुळे सबटायटल्स अविश्वसनीय होऊ शकतात. Claude ला ती अपडेट मिळते, ते नियोजन सुधारते आणि Gemini ला वेगळ्या पद्धतीने प्रयत्न करण्यास सांगते, जसे की टेक्स्ट ओव्हरले तयार करण्यापूर्वी स्पीकर सेगमेंट ओळखणे. API कडे 'स्टेट' असल्याने, ते सबटायटल ट्रॅक मूळ थरथरणार्या फुटेजऐवजी नवीन स्टेबिलायझेशन केलेल्या व्हिडिओशी जुळतो की नाही याची खात्री करू शकते.
जोपर्यंत चेकलिस्ट पूर्ण होत नाही तोपर्यंत ही प्रक्रिया सुरू राहते. ही प्रणाली केवळ एकदाच स्क्रिप्ट तयार करण्याऐवजी जटिल व्हिडिओ कामांसाठी एक वास्तविक वर्कफ्लो तयार करते. जर कोडेक सेटिंग सुसंगत नसल्यामुळे रेंडर अयशस्वी झाले, तर ती त्रुटी पुन्हा Claude कडे पाठवली जाते, जो पॅरामीटर्स बदलून पुन्हा प्रयत्न करू शकतो. पहिला अडथळा आल्यावर एजंट प्रकल्प सोडून देत नाही.
वेगवेगळ्या ताकदीसाठी वेगवेगळी मॉडेल्स वापरणे
The project also illustrates a broader design pattern in AI engineering: stop trying to make one model do it all. Claude Code excels at reasoning through ambiguous instructions, managing branching logic, and maintaining conversational context over a long session. The Gemini Interactions API, particularly in its interaction with rich media and tool use, brings deep multimodal capabilities and stateful execution. By wiring them together, you route around the limits of each.
A reasoning model that has never touched a nonlinear editor can still direct a great cut if it has access to an execution layer that understands codecs, keyframes, and track hierarchies. Conversely, a media-savvy API does not need to parse abstract creative notes if a planner model has already translated them into concrete steps. The strengths of one fix the weaknesses of the other.
This is not theoretical. The setup explicitly demonstrates how different AI models work together to handle a category of work, creative video editing, that single-model agents often fail to finish. For developers building agentic systems, the lesson is hard to ignore. Stop asking your orchestration layer to be your specialist, and stop asking your specialist to be your strategist.
What Builders Should Take Away
You do not need to be running a video studio to find this pattern useful. Any domain that requires multi-step work over a changing environment, CAD workflows, audio engineering, data visualization, or scientific computing, can borrow the same structure. One model acts as the persistent project manager. A specialized API or tool handles the stateful operations inside the domain-specific software.
The developer’s job shifts from writing giant prompts that pray the model remembers everything, to designing clean handoffs between reasoning and execution. State management becomes the critical piece. If your agent cannot see what changed after its last action, it cannot reliably act again.
You can read the full breakdown of how the integration works, including the specific API interactions and project structure, in the detailed post on dev.to.
The Real Takeaway
Solving complex creative work with AI does not require waiting for a single, perfect model that can plan, remember, and execute everything at once. It requires giving the agent a memory that survives between steps and a specialist it can actually delegate to. Let the thinker think. Let the editor edit.
