Gemini Omni milik Google, yang diakses melalui antara muka Google Vids yang baharu, telah melalui ujian makmal secara praktikal untuk melihat sama ada AI tersebut dapat mengekalkan kestabilan subjek-kurier tunggal selepas tiga suntingan video berturut-turut.

Mengapa ujian ini penting

Alat video generatif menjanjikan sesiapa sahaja boleh menukar latar belakang, menambah pencahayaan atau menambah kesan khas dengan satu arahan teks sahaja. Bagi seorang pencipta, janjinya mudah: bermula dengan klip mentah, taip “jadikan hujan pada waktu malam,” dan anda akan mendapat video pendek yang kemas. Kebanyakan pengguna tidak menyedari kos tersembunyi bagi “drift” (hanyutan)—kehilangan rupa, gaya atau pergerakan asal subjek secara beransur-ansur apabila AI mentafsir setiap arahan baharu. Jika wajah kurier berubah sedikit selepas suntingan kedua, hasil akhir akan kelihatan tidak profesional dan mungkin memerlukan pembersihan manual yang mahal.

Eksperimen

Klip asas – Rakaman studio dengan kamera statik memaparkan seorang individu memakai jaket windbreaker berwarna biru gelap, memegang kotak kadbod kecil di tangan kiri, dan melangkah dua langkah ke arah kamera. Pencahayaan adalah sekata, latar belakang kosong, dan pergerakannya ringkas.

Urutan suntingan – Tiga suntingan telah dilakukan satu demi satu:

  1. Tukar latar belakang – Gantikan studio dengan jalan raya bandar yang hujan pada waktu malam.
  2. Ubah suai pencahayaan – Tambah cahaya rim biru di sekeliling kurier dan cahaya hangat dari tingkap kedai.
  3. Lapisan atmosfera – Taburkan titisan hujan ringan dan selaput wap yang nipis.

Satu larian “kawalan langsung” menggabungkan ketiga-tiga arahan tersebut dalam satu prom, membolehkan AI menjana klip akhir dalam satu langkah sahaja.

Bagaimana konsistensi dinilai

Dua belas kriteria membentuk kad skor, yang dikumpulkan kepada empat tema:

  • Kestabilan watak – Wajah, rambut dan pakaian kekal serupa.
  • Kestabilan babak – Sudut kamera dan kedudukan subjek kekal tetap.
  • Ketepatan suntingan – AI mengikut arahan tanpa mengubah perkara lain.
  • Kualiti temporal – Tiada kelipan, herotan atau gegaran muncul semasa pergerakan.

Setiap klip dinilai pada bingkai pertama, titik tengah langkah dua langkah tersebut, dan bingkai terakhir. Pemarkahan mendedahkan corak yang jelas.

Apa yang dikatakan oleh angka tersebut

Apabila suntingan disusun berturut-turut, AI dinilai menggunakan kad skor tersebut. Kawalan prom tunggal menerima penilaian yang sama.

Siapa yang menang dan siapa yang kalah

Studio yang mampu menggunakan satu prom yang komprehensif akan mendapat aliran kerja yang lebih lancar. Pembangun sistem video generatif menghadapi cabaran kejuruteraan yang nyata—keperluan untuk mengekalkan representasi laten subjek yang stabil merentasi transformasi berturutan.

Hujah balas

Sesetengah pengguna berpendapat bahawa penyuntingan secara berperingkat menawarkan lebih banyak kawalan kreatif. Dengan melaraskan satu elemen pada satu masa, mereka boleh memperhalusi setiap lapisan sebelum beralih ke langkah seterusnya. Ujian ini menunjukkan bahawa fleksibiliti ini mengorbankan kesetiaan visual. Jika seorang pencipta menerima perubahan kecil pada subjek demi kawalan terperinci, aliran kerja Gemini Omni semasa mungkin masih boleh digunakan.

Apa yang perlu diperhatikan seterusnya

  • Penambahbaikan model yang mengunci kod laten subjek merentasi prom.
  • Gelung maklum balas pengguna yang membolehkan pencipta menandakan "drift" dan meminta “penambatan semula” (re-anchor) subjek.

Kesimpulan

Gemini Omni boleh menghasilkan video pelbagai elemen yang kemas apabila diberikan set arahan yang lengkap sekaligus, tetapi kesetiaan subjeknya merosot apabila suntingan disusun berturut-turut.