Sebagian besar perangkat lunak kreatif masih mengharuskan manusia berada di antara ide dan file akhir. Anda mungkin mendeskripsikan pengeditan video kepada AI, tetapi pekerjaan sebenarnya seperti memotong klip, menyesuaikan layer, dan mengekspor frame biasanya tetap menjadi tugas Anda. Kesenjangan itu ada karena pengeditan media bukanlah tugas satu kali prompt-dan-respons. Ini adalah rantai panjang keputusan yang saling bergantung, di mana langkah ketiga hanya masuk akal jika langkah kedua benar-benar mengubah timeline. Sebuah proyek yang baru-baru ini dibagikan mengatasi gesekan ini dengan menghubungkan Claude Code ke dalam pipeline pengeditan video stateful yang didukung oleh Gemini Interactions API. Hasilnya adalah demonstrasi kerja tentang cara membuat agen AI benar-benar mengarahkan alur kerja kreatif, bukan sekadar menyarankannya.

Seorang Sutradara dan Seorang Editor

Arsitekturnya sengaja dipisah. Claude Code beroperasi sebagai sutradara, menangani perencanaan tingkat tinggi, menafsirkan brief kreatif yang samar, dan memutuskan apa yang perlu dilakukan selanjutnya. Ia memecah permintaan seperti “potong bagian kosong dan tambahkan kartu judul” menjadi tugas-tugas terpisah, lalu memantau apakah setiap tugas berhasil sebelum melanjutkan.

Gemini Interactions API menangani logika pengeditan khusus. Alih-alih memaksa model generalis untuk mensimulasikan editor video, pengaturan ini menggunakan API Google sebagai operator praktis yang mengeksekusi potongan, mengevaluasi status timeline, dan melaporkan kembali dengan hasil konkret. Sistem ini tidak menggabungkan kedua pekerjaan tersebut ke dalam satu model tunggal. Ia menjaga lapisan penalaran (reasoning layer) terpisah dari lapisan penggunaan alat (tool-use layer), yang berarti setiap bagian dapat fokus pada keahlian terbaiknya.

Pembagian ini mencerminkan cara kerja tim pascaproduksi yang sebenarnya. Seorang sutradara memahami cerita dan mengambil keputusan. Editor memahami perangkat lunak dan memanipulasi piksel. Ketika sebuah agen mencoba melakukan keduanya di dalam satu context window, ia sering kali tersandung sintaksis atau lupa klip mana yang ada di trek mana. Membagi beban tersebut memperbaiki masalah itu.

Mengapa Memori Mengubah Segalanya

Pengeditan video pada dasarnya bersifat stateful. Jika Anda memperpendek klip sebanyak empat detik, setiap transisi, isyarat audio, dan penempatan subtitle berikutnya harus bergeser agar sesuai. Sebagian besar agen AI kesulitan di sini karena mereka memperlakukan setiap langkah sebagai kueri yang terisolasi. Mereka mungkin menyarankan pemotongan dalam satu respons, lalu berhalusinasi tentang timeline yang berbeda di respons berikutnya, atau menyarankan efek untuk segmen yang sudah tidak ada lagi.

Gemini Interactions API dibangun untuk mempertahankan state di seluruh operasi ini. Ia melacak kondisi aktual proyek saat agen bekerja. Itu berarti sistem mengetahui apakah ekspor gagal, apakah sebuah klip sudah diproses, atau apakah color grade telah diterapkan. Saat Claude memberikan instruksi berikutnya, ia bekerja berdasarkan status timeline saat ini yang sebenarnya, bukan sekadar tebakan.

Bagi siapa pun yang pernah melihat AI dengan percaya diri menyarankan perbaikan lima langkah yang “sederhana” namun sepenuhnya mengabaikan empat langkah sebelumnya, nilai dari state yang persisten sangatlah jelas. Tugas kreatif menurun kualitasnya dengan cepat tanpa memori. Backend yang stateful mengubah chatbot menjadi partisipan yang benar-benar dapat menyelesaikan pekerjaan.

Seperti Apa Alur Kerjanya

Bayangkan sebuah urutan praktis. Anda memasukkan beberapa klip mentah ke dalam sistem dan meminta hasil potongan media sosial yang sudah jadi. Claude Code pertama-tama mengevaluasi permintaan tersebut. Ia mungkin memutuskan bahwa rekaman tersebut perlu stabilisasi, lalu ekstraksi voice-over, lalu subtitle, lalu pemotongan vertikal (vertical crop). Ia menyusun ini sebagai sebuah rencana dan mulai memanggil Gemini Interactions API untuk mengeksekusi setiap item secara berurutan.

Gemini melakukan operasi media dan mengembalikan umpan balik terstruktur. Mungkin stabilisasi berhasil, tetapi pemisahan audio menemukan dialog yang tumpang tindih yang membuat subtitle menjadi tidak akurat. Claude menerima pembaruan tersebut, merevisi rencana, dan meminta Gemini untuk mencoba pendekatan berbeda, seperti mengidentifikasi segmen pembicara sebelum menghasilkan overlay teks. Karena API menyimpan state, ia dapat mengonfirmasi bahwa trek subtitle selaras dengan video yang baru saja distabilisasi, bukan rekaman asli yang bergoyang.

Loop ini berlanjut hingga daftar periksa selesai. Sistem ini menciptakan alur kerja yang nyata untuk tugas video yang kompleks, alih-alih sekadar pembuatan skrip sekali jalan. Jika render gagal karena pengaturan codec tidak kompatibel, kesalahan tersebut dikirim kembali ke Claude, yang kemudian dapat menyesuaikan parameter dan mencoba lagi. Agen tersebut tidak meninggalkan proyek setelah rintangan pertama.

Menggunakan Model yang Berbeda untuk Kekuatan yang Berbeda

Proyek ini juga mengilustrasikan pola desain yang lebih luas dalam rekayasa AI: berhentilah mencoba membuat satu model melakukan segalanya. Claude Code unggul dalam menalar instruksi yang ambigu, mengelola logika percabangan, dan mempertahankan konteks percakapan selama sesi yang panjang. Gemini Interactions API, terutama dalam interaksinya dengan media kaya (rich media) dan penggunaan alat (tool use), menghadirkan kemampuan multimodal yang mendalam dan eksekusi berbasis status (stateful execution). Dengan menghubungkan keduanya, Anda dapat mengatasi keterbatasan masing-masing.

Model penalaran yang belum pernah menyentuh editor non-linear tetap dapat mengarahkan pemotongan (cut) yang hebat jika ia memiliki akses ke lapisan eksekusi yang memahami codec, keyframe, dan hierarki trek. Sebaliknya, API yang mahir media tidak perlu mengurai catatan kreatif yang abstrak jika model perencana telah menerjemahkannya menjadi langkah-langkah konkret. Kekuatan satu model menutupi kelemahan model lainnya.

Ini bukan sekadar teori. Pengaturan ini secara eksplisit mendemonstrasikan bagaimana berbagai model AI bekerja sama untuk menangani kategori pekerjaan, yaitu penyuntingan video kreatif, yang sering kali gagal diselesaikan oleh agen model tunggal. Bagi pengembang yang membangun sistem agen (agentic systems), pelajaran ini sulit untuk diabaikan. Berhentilah meminta lapisan orkestrasi Anda untuk menjadi spesialis Anda, dan berhentilah meminta spesialis Anda untuk menjadi ahli strategi Anda.

Pelajaran bagi Para Builder

Anda tidak perlu menjalankan studio video untuk menemukan pola ini bermanfaat. Domain apa pun yang memerlukan pekerjaan multi-langkah dalam lingkungan yang berubah-ubah, alur kerja CAD, rekayasa audio, visualisasi data, atau komputasi ilmiah, dapat meminjam struktur yang sama. Satu model bertindak sebagai manajer proyek yang persisten. API atau alat khusus menangani operasi berbasis status (stateful operations) di dalam perangkat lunak spesifik domain tersebut.

Tugas pengembang bergeser dari menulis prompt raksasa yang berharap model mengingat segalanya, menjadi merancang serah terima (handoff) yang bersih antara penalaran dan eksekusi. Manajemen status (state management) menjadi bagian yang krusial. Jika agen Anda tidak dapat melihat apa yang berubah setelah tindakan terakhirnya, ia tidak dapat bertindak kembali secara andal.

Anda dapat membaca rincian lengkap tentang cara kerja integrasi ini, termasuk interaksi API tertentu dan struktur proyek, dalam postingan mendalam di dev.to.

Intisari Utamanya

Menyelesaikan pekerjaan kreatif yang kompleks dengan AI tidak mengharuskan kita menunggu satu model sempurna yang dapat merencanakan, mengingat, dan mengeksekusi segalanya sekaligus. Hal ini memerlukan pemberian memori kepada agen yang bertahan di antara langkah-langkah dan seorang spesialis yang benar-benar dapat ia delegasikan tugas kepadanya. Biarkan si pemikir berpikir. Biarkan si penyunting menyunting.