Google’s Gemini Omni ซึ่งเข้าถึงได้ผ่านอินเทอร์เฟซ Google Vids ใหม่ ได้ถูกนำมาทดสอบในห้องปฏิบัติการเพื่อดูว่า AI จะสามารถรักษาความเสถียรของตัวละครหลัก (subject-courier) ได้หรือไม่ หลังจากผ่านการตัดต่อวิดีโอต่อเนื่องกันสามครั้ง

ทำไมการทดสอบนี้จึงสำคัญ

เครื่องมือสร้างวิดีโอด้วย AI (Generative video tools) ให้คำมั่นว่าใครๆ ก็สามารถเปลี่ยนพื้นหลัง เพิ่มแสง หรือใส่เอฟเฟกต์ได้ด้วยคำสั่งข้อความเพียงชุดเดียว สำหรับครีเอเตอร์แล้ว คำสัญญานี้ช่างเรียบง่าย: เริ่มต้นด้วยคลิปดิบ พิมพ์ว่า “ทำให้ฝนตกตอนกลางคืน” แล้วคุณก็จะได้วิดีโอสั้นที่ดูสมบูรณ์แบบ ผู้ใช้ส่วนใหญ่อาจไม่เห็นต้นทุนที่ซ่อนอยู่ของอาการ “drift” หรือการสูญเสียรูปลักษณ์ ท่าทาง หรือการเคลื่อนไหวเดิมของตัวละครไปทีละน้อยในขณะที่ AI ตีความคำสั่งใหม่แต่ละครั้ง หากใบหน้าของพนักงานส่งของ (courier) เปลี่ยนไปเล็กน้อยหลังจากการตัดต่อครั้งที่สอง ผลงานสุดท้ายจะดูไม่เป็นมืออาชีพและอาจต้องใช้การแก้ไขด้วยมือซึ่งมีค่าใช้จ่ายสูง

การทดลอง

คลิปต้นแบบ (Baseline clip) – ภาพถ่ายในสตูดิโอโดยใช้กล้องแบบตั้งนิ่ง เป็นภาพคนหนึ่งคนสวมเสื้อกันลมสีน้ำเงินเข้ม ถือกล่องกระดาษขนาดเล็กด้วยมือซ้าย และก้าวเดินสองก้าวเข้าหาหน้ากล้อง แสงมีความสม่ำเสมอ พื้นหลังเรียบง่าย และการเคลื่อนไหวไม่ซับซ้อน

ลำดับการตัดต่อ – มีการตัดต่อสามครั้งต่อเนื่องกัน:

  1. การเปลี่ยนพื้นหลัง – เปลี่ยนจากสตูดิโอเป็นถนนในเมืองที่มีฝนตกในตอนกลางคืน
  2. การปรับแสง – เพิ่มแสงขอบสีน้ำเงิน (blue rim light) รอบตัวพนักงานส่งของ และแสงสีอุ่นจากหน้าต่างร้านค้า
  3. การเพิ่มชั้นบรรยากาศ – ใส่ละอองฝนเบาๆ และไอหมอกบางๆ

การทดสอบแบบ “การควบคุมโดยตรง” (direct control) จะรวมคำสั่งทั้งสามเข้าด้วยกันในพรอมต์ (prompt) เดียว เพื่อให้ AI สร้างคลิปสุดท้ายขึ้นมาในคราวเดียว

เกณฑ์การให้คะแนนความสม่ำเสมอ

เกณฑ์การให้คะแนนประกอบด้วย 12 หัวข้อ ซึ่งแบ่งออกเป็น 4 หัวข้อหลัก:

  • ความเสถียรของตัวละคร (Character stability) – ใบหน้า ทรงผม และเสื้อผ้ายังคงเหมือนเดิมทุกประการ
  • ความเสถียรของฉาก (Scene stability) – มุมกล้องและตำแหน่งของตัวละครยังคงที่
  • ความแม่นยำในการตัดต่อ (Edit precision) – AI ทำตามคำสั่งโดยไม่เปลี่ยนแปลงส่วนอื่น
  • คุณภาพด้านเวลา (Temporal quality) – ไม่มีการกระพริบ การบิดเบี้ยว หรืออาการสั่นไหว (jitter) ระหว่างการเคลื่อนไหว

คลิปแต่ละคลิปจะถูกประเมินที่เฟรมแรก ช่วงกึ่งกลางของการเดินสองก้าว และเฟรมสุดท้าย ซึ่งผลคะแนนเผยให้เห็นรูปแบบที่ชัดเจน

ข้อมูลเชิงตัวเลขบอกอะไรเรา

เมื่อมีการตัดต่อแบบซ้อนทับกัน (stacked) AI จะถูกประเมินโดยใช้เกณฑ์การให้คะแนนดังกล่าว ส่วนการทดสอบแบบใช้พรอมต์เดียว (single-prompt control) จะได้รับการประเมินในรูปแบบเดียวกัน

ใครได้ประโยชน์และใครเสียประโยชน์

สตูดิโอที่สามารถใช้พรอมต์เดียวที่ครอบคลุมทุกอย่างได้ จะมีเวิร์กโฟลว์ที่ราบรื่นกว่า ส่วนนักพัฒนาเทคโนโลยีวิดีโอแบบ Generative กำลังเผชิญกับอุปสรรคทางวิศวกรรมที่ชัดเจน นั่นคือความจำเป็นในการรักษาความเสถียรของตัวแทนแฝง (latent representation) ของตัวละครตลอดการเปลี่ยนแปลงที่เกิดขึ้นต่อเนื่องกัน

ข้อโต้แย้ง

ผู้ใช้บางส่วนแย้งว่าการตัดต่อแบบทีละขั้นตอน (incremental editing) ช่วยให้ควบคุมความคิดสร้างสรรค์ได้มากกว่า การปรับเปลี่ยนทีละองค์ประกอบช่วยให้สามารถปรับแต่งแต่ละเลเยอร์ได้อย่างละเอียดก่อนจะไปขั้นตอนถัดไป อย่างไรก็ตาม ผลการทดสอบแสดงให้เห็นว่าความยืดหยุ่นนี้ต้องแลกมาด้วยความสมจริงของภาพ (visual fidelity) หากครีเอเตอร์ยอมรับการเปลี่ยนแปลงเล็กน้อยของตัวละครเพื่อแลกกับการควบคุมที่ละเอียดขึ้น เวิร์กโฟลว์ของ Gemini Omni ในปัจจุบันก็อาจยังใช้งานได้ดีอยู่

สิ่งที่ต้องจับตามองต่อไป

  • การปรับปรุงโมเดล (Model refinements) ที่สามารถล็อกรหัสแฝง (latent code) ของตัวละครไว้ได้ในทุกๆ พรอมต์
  • วงจรการตอบรับจากผู้ใช้ (User-feedback loops) ที่ช่วยให้ครีเอเตอร์สามารถแจ้งเตือนเมื่อเกิดอาการ drift และขอให้มีการ "ยึดตำแหน่งเดิม" (re-anchor) ของตัวละครได้

บทสรุป

Gemini Omni สามารถสร้างวิดีโอที่มีองค์ประกอบหลากหลายและดูสมบูรณ์แบบได้หากได้รับชุดคำสั่งที่ครบถ้วนในคราวเดียว แต่ความแม่นยำของตัวละครจะลดลงเมื่อมีการตัดต่อแบบซ้อนทับกัน