ซอฟต์แวร์สร้างสรรค์ส่วนใหญ่ยังคงต้องการให้มนุษย์เป็นตัวกลางระหว่างไอเดียและไฟล์ที่เสร็จสมบูรณ์ คุณอาจจะอธิบายการตัดต่อวิดีโอให้ AI ฟัง แต่การทำงานจริงอย่างการตัดคลิป การปรับเลเยอร์ และการส่งออกเฟรม มักจะตกเป็นหน้าที่ของคุณ ช่องว่างนั้นเกิดขึ้นเพราะการตัดต่อสื่อไม่ใช่แค่การสั่งงานแบบ prompt-and-response เพียงครั้งเดียว แต่มันคือห่วงโซ่ของการตัดสินใจที่ต่อเนื่องกัน ซึ่งขั้นตอนที่สามจะมีเหตุผลก็ต่อเมื่อขั้นตอนที่สองได้เปลี่ยนแปลงไทม์ไลน์ไปแล้วจริงๆ โปรเจกต์ที่เพิ่งมีการแบ่งปันกันเมื่อเร็วๆ นี้ ได้จัดการกับปัญหาความติดขัดนี้โดยการเชื่อมต่อ Claude Code เข้ากับ pipeline การตัดต่อวิดีโอแบบ stateful ที่ขับเคลื่อนด้วย Gemini Interactions API ผลลัพธ์ที่ได้คือการสาธิตการทำงานที่แสดงให้เห็นว่าเราจะทำให้ AI agent เข้ามาควบคุมเวิร์กโฟลว์สร้างสรรค์ได้อย่างแท้จริง แทนที่จะเป็นเพียงแค่การให้คำแนะนำ
ผู้กำกับและช่างตัดต่อ
สถาปัตยกรรมนี้ถูกแยกออกจากกันอย่างตั้งใจ Claude Code ทำหน้าที่เป็นผู้กำกับ โดยจัดการการวางแผนระดับสูง ตีความบรีฟงานสร้างสรรค์ที่คลุมเครือ และตัดสินใจว่าต้องทำอะไรต่อไป มันจะย่อยคำสั่งอย่างเช่น “ตัดช่วงเงียบออกและเพิ่มการ์ดชื่อเรื่อง” ให้เป็นงานย่อยๆ จากนั้นจะตรวจสอบว่าแต่ละงานสำเร็จหรือไม่ก่อนที่จะดำเนินการต่อ
Gemini Interactions API จะจัดการตรรกะการตัดต่อเฉพาะทาง แทนที่จะบังคับให้โมเดลแบบ generalist มาจำลองเป็นช่างตัดต่อวิดีโอ การตั้งค่านี้ใช้ API ของ Google เป็นผู้ปฏิบัติงานที่ลงมือทำจริง ทั้งการตัดต่อ การประเมินสถานะของไทม์ไลน์ และรายงานผลกลับมาด้วยผลลัพธ์ที่เป็นรูปธรรม ระบบไม่ได้รวมงานทั้งสองอย่างเข้าเป็นโมเดลเดียว แต่มันแยกชั้นการใช้เหตุผล (reasoning layer) ออกจากชั้นการใช้เครื่องมือ (tool-use layer) ซึ่งหมายความว่าแต่ละส่วนสามารถโฟกัสในสิ่งที่ตัวเองทำได้ดีที่สุด
การแบ่งงานแบบนี้สะท้อนถึงวิธีการทำงานของทีม post-production จริงๆ ผู้กำกับรู้เรื่องราวและเป็นคนตัดสินใจ ช่างตัดต่อรู้เรื่องซอฟต์แวร์และจัดการกับพิกเซล เมื่อ agent พยายามทำทั้งสองอย่างภายใน context window เดียวกัน บ่อยครั้งที่มันจะติดขัดเรื่องไวยากรณ์หรือลืมว่าคลิปไหนอยู่บนแทร็กไหน การแยกภาระงานช่วยแก้ปัญหานี้ได้
ทำไมความจำถึงเปลี่ยนทุกอย่าง
การตัดต่อวิดีโอมีลักษณะเป็น stateful โดยธรรมชาติ หากคุณตัดคลิปให้สั้นลง 4 วินาที ทุกๆ transition, สัญญาณเสียง และการวางคำบรรยายที่ตามมาจะต้องขยับตามเพื่อให้สอดคล้องกัน AI agent ส่วนใหญ่ประสบปัญหานี้เพราะพวกมันมองว่าแต่ละขั้นตอนเป็นคำสั่งที่แยกจากกัน พวกมันอาจแนะนำการตัดในคำตอบหนึ่ง แล้วเกิดอาการหลอน (hallucinate) ไทม์ไลน์ที่ต่างออกไปในคำตอบถัดไป หรือแนะนำเอฟเฟกต์สำหรับส่วนที่ไม่มีอยู่แล้ว
Gemini Interactions API ถูกสร้างขึ้นเพื่อรักษา state ตลอดการทำงานเหล่านี้ มันจะติดตามสถานะจริงของโปรเจกต์ในขณะที่ agent กำลังทำงาน นั่นหมายความว่าระบบจะรู้ว่าการส่งออกล้มเหลวหรือไม่ คลิปได้รับการประมวลผลไปแล้วหรือยัง หรือมีการปรับสี (color grade) ไปแล้วหรือยัง เมื่อ Claude ออกคำสั่งถัดไป มันจะทำงานโดยอิงจากสถานะปัจจุบันจริงๆ ของไทม์ไลน์ ไม่ใช่การคาดเดา
สำหรับใครก็ตามที่เคยเห็น AI แนะนำวิธีแก้ไข “ง่ายๆ” 5 ขั้นตอนอย่างมั่นใจ แต่กลับละเลย 4 ขั้นตอนก่อนหน้าไปอย่างสิ้นเชิง คุณจะเห็นคุณค่าของ persistent state ได้อย่างชัดเจน งานสร้างสรรค์จะด้อยประสิทธิภาพลงอย่างรวดเร็วหากขาดความจำ backend แบบ stateful จะเปลี่ยน chatbot ให้กลายเป็นผู้มีส่วนร่วมที่สามารถทำงานให้เสร็จสิ้นได้จริงๆ
เวิร์กโฟลว์มีลักษณะอย่างไร
ลองจินตนาการถึงลำดับการทำงานที่ใช้งานได้จริง คุณป้อนคลิปดิบหลายคลิปเข้าสู่ระบบและสั่งให้ตัดต่อเพื่อลงโซเชียลมีเดียให้เสร็จสมบูรณ์ Claude Code จะประเมินคำขอเป็นอันดับแรก มันอาจตัดสินใจว่าฟุตเทจต้องมีการทำ stabilization จากนั้นจึงเป็นการแยกเสียงพากย์ (voice-over extraction) ตามด้วยคำบรรยาย และการครอปเป็นแนวตั้ง มันจะจัดโครงสร้างสิ่งเหล่านี้เป็นแผนงาน และเริ่มเรียกใช้ Gemini Interactions API เพื่อดำเนินการแต่ละรายการตามลำดับ
Gemini จะดำเนินการด้านสื่อและส่งคืนผลตอบรับที่มีโครงสร้าง บางทีการทำ stabilization อาจสำเร็จ แต่การแยกเสียงกลับพบว่ามีบทสนทนาที่ซ้อนทับกันซึ่งทำให้คำบรรยายไม่น่าเชื่อถือ Claude จะได้รับข้อมูลอัปเดตนั้น ปรับปรุงแผนงาน และขอให้ Gemini ลองใช้วิธีอื่น เช่น การระบุช่วงของผู้พูดก่อนที่จะสร้างข้อความซ้อนทับ (text overlays) เนื่องจาก API รักษา state ไว้ มันจึงสามารถยืนยันได้ว่าแทร็กคำบรรยายนั้นตรงกับวิดีโอที่ทำ stabilization ใหม่แล้ว ไม่ใช่ฟุตเทจที่สั่นไหวแบบเดิม
ลูปนี้จะดำเนินต่อไปจนกว่ารายการตรวจสอบจะเสร็จสิ้น ระบบสร้างเวิร์กโฟลว์ที่แท้จริงสำหรับงานวิดีโอที่ซับซ้อน แทนที่จะเป็นการสร้างสคริปต์แบบครั้งเดียวจบ หากการเรนเดอร์ล้มเหลวเนื่องจากการตั้งค่า codec ไม่รองรับ ข้อผิดพลาดจะถูกส่งกลับไปยัง Claude ซึ่งสามารถปรับพารามิเตอร์และลองใหม่ได้ agent จะไม่ละทิ้งโปรเจกต์หลังจากเจออุปสรรคแรก
การใช้โมเดลที่แตกต่างกันเพื่อดึงจุดแข็งที่ต่างกัน
โปรเจกต์นี้ยังแสดงให้เห็นถึงรูปแบบการออกแบบ (design pattern) ที่กว้างขึ้นในด้านวิศวกรรม AI นั่นคือ: เลิกพยายามทำให้โมเดลเดียวทำทุกอย่าง Claude Code มีความโดดเด่นในการใช้เหตุผลผ่านคำสั่งที่คลุมเครือ การจัดการตรรกะแบบแยกย่อย (branching logic) และการรักษาบริบทของการสนทนาตลอดเซสชันที่ยาวนาน ส่วน Gemini Interactions API โดยเฉพาะอย่างยิ่งในการทำงานร่วมกับสื่อมัลติมีเดีย (rich media) และการใช้เครื่องมือ (tool use) ช่วยมอบความสามารถด้านมัลติโมดัล (multimodal) ที่ลึกซึ้งและการประมวลผลแบบรักษาลำดับสถานะ (stateful execution) การเชื่อมต่อพวกมันเข้าด้วยกันช่วยให้คุณก้าวข้ามขีดจำกัดของแต่ละโมเดลได้
โมเดลที่เน้นการใช้เหตุผลซึ่งไม่เคยสัมผัสโปรแกรมตัดต่อวิดีโอแบบ Nonlinear มาก่อน ก็ยังสามารถกำกับการตัดต่อที่ยอดเยี่ยมได้ หากมันสามารถเข้าถึงเลเยอร์การประมวลผล (execution layer) ที่เข้าใจเรื่อง codec, keyframe และลำดับชั้นของแทร็ก (track hierarchies) ในทางกลับกัน API ที่เชี่ยวชาญด้านสื่อไม่จำเป็นต้องตีความบันทึกเชิงสร้างสรรค์ที่เป็นนามธรรม หากโมเดลผู้วางแผน (planner model) ได้แปลสิ่งเหล่านั้นให้เป็นขั้นตอนที่จับต้องได้แล้ว จุดแข็งของอย่างหนึ่งจะเข้ามาอุดจุดอ่อนของอีกอย่างหนึ่ง
นี่ไม่ใช่แค่ทฤษฎี การตั้งค่านี้แสดงให้เห็นอย่างชัดเจนว่าโมเดล AI ที่แตกต่างกันทำงานร่วมกันอย่างไรเพื่อจัดการกับงานประเภทหนึ่ง นั่นคือการตัดต่อวิดีโอเชิงสร้างสรรค์ ซึ่งเอเจนต์แบบโมเดลเดี่ยว (single-model agents) มักจะทำไม่สำเร็จ สำหรับนักพัฒนาที่กำลังสร้างระบบเอเจนต์ (agentic systems) บทเรียนนี้เป็นสิ่งที่ยากจะมองข้าม เลิกคาดหวังให้เลเยอร์การประสานงาน (orchestration layer) ของคุณเป็นผู้เชี่ยวชาญเฉพาะทาง และเลิกคาดหวังให้ผู้เชี่ยวชาญของคุณเป็นนักวางกลยุทธ์
สิ่งที่ผู้สร้างควรได้รับจากเรื่องนี้
คุณไม่จำเป็นต้องทำสตูดิโอวิดีโอถึงจะเห็นประโยชน์ของรูปแบบนี้ ทุกโดเมนที่ต้องมีการทำงานหลายขั้นตอนในสภาพแวดล้อมที่เปลี่ยนแปลงตลอดเวลา เช่น เวิร์กโฟลว์ CAD, วิศวกรรมเสียง, การแสดงข้อมูลด้วยภาพ (data visualization) หรือการคำนวณทางวิทยาศาสตร์ ก็สามารถนำโครงสร้างแบบเดียวกันนี้ไปใช้ได้ โดยให้โมเดลหนึ่งทำหน้าที่เป็นผู้จัดการโครงการที่คอยติดตามงานอย่างต่อเนื่อง และให้ API หรือเครื่องมือเฉพาะทางจัดการการทำงานแบบรักษาลำดับสถานะ (stateful operations) ภายในซอฟต์แวร์เฉพาะทางนั้นๆ
หน้าที่ของนักพัฒนาจะเปลี่ยนจากการเขียนพรอมต์ (prompt) ขนาดมหึมาเพื่อภาวนาให้โมเดลจำทุกอย่างได้ ไปเป็นการออกแบบการส่งต่องาน (handoffs) ที่ชัดเจนระหว่างการใช้เหตุผลและการประมวลผล การจัดการสถานะ (state management) จะกลายเป็นส่วนสำคัญ หากเอเจนต์ของคุณไม่เห็นว่ามีอะไรเปลี่ยนแปลงไปหลังจากดำเนินการครั้งล่าสุด มันก็จะไม่สามารถดำเนินการต่อได้อย่างน่าเชื่อถือ
คุณสามารถอ่านรายละเอียดทั้งหมดเกี่ยวกับวิธีการทำงานของการผสานรวมนี้ รวมถึงการโต้ตอบของ API และโครงสร้างโปรเจกต์ที่เฉพาะเจาะจง ได้ในโพสต์ฉบับเต็มที่ dev.to
บทสรุปที่แท้จริง
การแก้ปัญหาการทำงานเชิงสร้างสรรค์ที่ซับซ้อนด้วย AI ไม่จำเป็นต้องรอโมเดลที่สมบูรณ์แบบเพียงตัวเดียวที่สามารถวางแผน จดจำ และดำเนินการทุกอย่างได้พร้อมกัน แต่มันคือการมอบความจำที่ต่อเนื่องระหว่างขั้นตอนให้กับเอเจนต์ และมอบผู้เชี่ยวชาญที่มันสามารถมอบหมายงานให้ได้จริงๆ ปล่อยให้ผู้คิดได้คิด ปล่อยให้ผู้ตัดต่อได้ตัดต่อ
