Kebanyakan perisian kreatif masih memerlukan manusia berada di antara idea dan fail yang siap. Anda mungkin menerangkan suntingan video kepada AI, tetapi kerja sebenar seperti memotong klip, melaraskan lapisan, dan mengeksport bingkai biasanya jatuh kepada anda semula. Jurang itu wujud kerana penyuntingan media bukanlah tugasan satu arahan-dan-respons sahaja. Ia adalah rantaian panjang keputusan yang saling bergantung di mana langkah ketiga hanya masuk akal jika langkah kedua benar-benar mengubah garis masa (timeline). Sebuah projek yang dikongsi baru-baru ini menangani geseran ini dengan menyambungkan Claude Code ke dalam saluran paip (pipeline) penyuntingan video berasaskan keadaan (stateful) yang dikuasakan oleh Gemini Interactions API. Hasilnya adalah demonstrasi berfungsi tentang cara membolehkan ejen AI benar-benar mengarahkan aliran kerja kreatif dan bukannya sekadar mencadangkannya.
Seorang Pengarah dan Seorang Penyunting
Seni bina ini sengaja dipecahkan. Claude Code beroperasi sebagai pengarah, mengendalikan perancangan peringkat tinggi, mentafsir ringkasan kreatif yang samar, dan memutuskan apa yang perlu dilakukan seterusnya. Ia memecahkan permintaan seperti “potong ruang kosong dan tambah kad tajuk” kepada tugasan-tugasan khusus, kemudian memantau sama ada setiap tugasan berjaya sebelum beralih ke langkah seterusnya.
Gemini Interactions API mengendalikan logik penyuntingan khusus. Daripada memaksa model umum untuk mensimulasikan penyunting video, tetapan ini menggunakan API Google sebagai pengendali praktikal yang melaksanakan potongan, menilai keadaan garis masa, dan melaporkan semula dengan hasil yang nyata. Sistem ini tidak menggabungkan kedua-dua tugas tersebut ke dalam satu model tunggal. Ia mengekalkan lapisan penaakulan berasingan daripada lapisan penggunaan alatan, yang bermaksud setiap bahagian boleh fokus pada apa yang terbaik bagi fungsinya.
Pembahagian ini mencerminkan cara pasukan pascaproduksi sebenar berfungsi. Seorang pengarah mengetahui jalan cerita dan membuat keputusan. Penyunting mengetahui perisian dan memanipulasi piksel. Apabila ejen cuba melakukan kedua-duanya di dalam satu tetingkap konteks, ia sering tersilap pada sintaks atau terlupa klip mana yang berada pada trek mana. Membahagikan beban kerja menyelesaikan masalah tersebut.
Mengapa Memori Mengubah Segalanya
Penyuntingan video secara semula jadi adalah berasaskan keadaan (stateful). Jika anda memendekkan klip sebanyak empat saat, setiap peralihan, isyarat audio, dan penempatan sari kata yang menyusul mesti beralih untuk menyesuaikan diri. Kebanyakan ejen AI bergelut di sini kerana mereka menganggap setiap langkah sebagai pertanyaan yang terasing. Mereka mungkin mencadangkan potongan dalam satu respons, kemudian berhalusinasi tentang garis masa yang berbeza dalam respons seterusnya, atau mencadangkan kesan untuk segmen yang tidak lagi wujud.
Gemini Interactions API dibina untuk mengekalkan keadaan (state) merentasi operasi-operasi ini. Ia menjejaki keadaan sebenar projek semasa ejen bekerja. Ini bermakna sistem mengetahui sama ada eksport gagal, sama ada klip telah diproses, atau sama ada gred warna telah diaplikasikan. Apabila Claude mengeluarkan arahan seterusnya, ia bekerja berdasarkan keadaan semasa garis masa yang sebenar, bukan sekadar tekaan.
Bagi sesiapa yang pernah melihat AI mencadangkan penyelesaian lima langkah yang “mudah” dengan penuh yakin tetapi mengabaikan sepenuhnya empat langkah sebelumnya, nilai keadaan yang berterusan (persistent state) adalah jelas. Tugasan kreatif merosot dengan cepat tanpa memori. Backend berasaskan keadaan (stateful backend) mengubah chatbot menjadi peserta yang benar-benar boleh menyiapkan tugasan.
Bagaimana Rupa Aliran Kerja Tersebut
Bayangkan satu urutan praktikal. Anda memasukkan beberapa klip mentah ke dalam sistem dan meminta suntingan media sosial yang siap. Claude Code terlebih dahulu menilai permintaan tersebut. Ia mungkin memutuskan bahawa rakaman memerlukan penstabilan, kemudian pengekstrakan suara latar, kemudian sari kata, kemudian pemotongan menegak (vertical crop). Ia menyusun perkara ini sebagai satu pelan dan mula memanggil Gemini Interactions API untuk melaksanakan setiap item mengikut urutan.
Gemini melaksanakan operasi media dan mengembalikan maklum balas berstruktur. Mungkin penstabilan berjaya tetapi pengasingan audio menemui dialog yang bertindih yang menyebabkan sari kata tidak boleh dipercayai. Claude menerima kemas kini tersebut, menyemak semula pelan, dan meminta Gemini untuk mencuba pendekatan berbeza, seperti mengenal pasti segmen pembicara sebelum menjana lapisan teks (text overlays). Oleh kerana API tersebut menyimpan keadaan (state), ia boleh mengesahkan bahawa trek sari kata selaras dengan video yang baru distabilkan, bukan rakaman asal yang bergoyang.
Gelung ini berterusan sehingga senarai semak selesai. Sistem ini mencipta aliran kerja yang tulen untuk tugasan video yang kompleks dan bukannya penjanaan skrip sekali guna. Jika render gagal kerana tetapan codec tidak serasi, ralat tersebut akan dihantar semula kepada Claude, yang boleh melaraskan parameter dan mencuba semula. Ejen tersebut tidak meninggalkan projek selepas halangan pertama.
Menggunakan Model Berbeza untuk Kekuatan yang Berbeza
Projek ini juga menggambarkan corak reka bentuk yang lebih luas dalam kejuruteraan AI: berhenti cuba membuat satu model melakukan segalanya. Claude Code cemerlang dalam menaakul melalui arahan yang kabur, mengurus logik bercabang, dan mengekalkan konteks perbualan sepanjang sesi yang panjang. Gemini Interactions API, terutamanya dalam interaksinya dengan media kaya dan penggunaan alatan, membawa keupayaan multimodal yang mendalam dan pelaksanaan berstatus. Dengan menghubungkannya, anda dapat mengatasi had setiap satu.
Model penaakulan yang tidak pernah menyentuh penyunting bukan linear masih boleh mengarahkan suntingan yang hebat jika ia mempunyai akses kepada lapisan pelaksanaan yang memahami codec, bingkai kunci, dan hierarki trek. Sebaliknya, API yang mahir media tidak perlu menterjemah nota kreatif yang abstrak jika model perancang telah menterjemahkannya kepada langkah-langkah konkrit. Kekuatan satu pihak memperbaiki kelemahan pihak yang lain.
Ini bukan sekadar teori. Tetapan ini menunjukkan secara eksplisit bagaimana model AI yang berbeza bekerjasama untuk mengendalikan satu kategori kerja, iaitu penyuntingan video kreatif, yang sering gagal diselesaikan oleh ejen model tunggal. Bagi pembangun yang membina sistem ejen, pengajaran ini sukar untuk diabaikan. Berhenti meminta lapisan orkestrasi anda menjadi pakar anda, dan berhenti meminta pakar anda menjadi pakar strategi anda.
Apa yang Perlu Diambil Perhatian oleh Pembina
Anda tidak perlu mengendalikan studio video untuk mendapati corak ini berguna. Mana-mana domain yang memerlukan kerja pelbagai langkah dalam persekitaran yang berubah-ubah, aliran kerja CAD, kejuruteraan audio, visualisasi data, atau pengkomputeran saintifik, boleh meminjam struktur yang sama. Satu model bertindak sebagai pengurus projek yang berterusan. API atau alatan khusus mengendalikan operasi berstatus di dalam perisian khusus domain tersebut.
Tugas pembangun beralih daripada menulis prom yang besar dengan harapan model mengingati segalanya, kepada mereka bentuk penyerahan yang bersih antara penaakulan dan pelaksanaan. Pengurusan status menjadi bahagian yang kritikal. Jika ejen anda tidak dapat melihat apa yang berubah selepas tindakan terakhirnya, ia tidak dapat bertindak semula dengan boleh dipercayai.
Anda boleh membaca pecahan penuh tentang cara integrasi berfungsi, termasuk interaksi API yang khusus dan struktur projek, dalam hantaran terperinci di dev.to.
Intipati Sebenar
Menyelesaikan kerja kreatif yang kompleks dengan AI tidak memerlukan anda menunggu satu model tunggal yang sempurna yang boleh merancang, mengingati, dan melaksanakan segalanya sekaligus. Ia memerlukan pemberian memori kepada ejen yang kekal di antara langkah-langkah dan seorang pakar yang boleh didelegasikan kepadanya. Biarkan pemikir berfikir. Biarkan penyunting menyunting.
