Gemini Omni milik Google, yang diakses melalui antarmuka Google Vids baru, menjalani uji coba lab praktis untuk melihat apakah AI tersebut dapat menjaga stabilitas subjek-kurir tunggal setelah tiga pengeditan video berturut-turut.

Mengapa pengujian ini penting

Alat video generatif menjanjikan bahwa siapa pun dapat mengganti latar belakang, menambah pencahayaan, atau menyebarkan efek hanya dengan satu perintah teks. Bagi seorang kreator, janjinya sederhana: mulai dengan klip mentah, ketik “buat hujan di malam hari,” dan Anda akan mendapatkan video pendek yang apik. Sebagian besar pengguna tidak melihat biaya tersembunyi dari “drift”—hilangnya penampilan, pose, atau gerakan subjek asli secara bertahap saat AI menafsirkan setiap instruksi baru. Jika wajah seorang kurir berubah sedikit saja setelah pengeditan kedua, hasil akhirnya akan terlihat tidak profesional dan mungkin memerlukan pembersihan manual yang mahal.

Eksperimen

Klip dasar – Sebuah pengambilan gambar studio dengan kamera statis yang menampilkan satu orang mengenakan jaket windbreaker biru dongker, memegang kotak kardus kecil di tangan kiri, dan melangkah dua langkah ke arah kamera. Pencahayaannya merata, latar belakangnya polos, dan gerakannya sederhana.

Urutan pengeditan – Tiga pengeditan diterapkan satu demi satu:

  1. Penggantian latar belakang – Mengganti studio dengan jalanan kota yang hujan di malam hari.
  2. Penyesuaian pencahayaan – Menambahkan cahaya tepi (rim light) biru di sekitar kurir dan cahaya hangat dari jendela toko.
  3. Lapisan atmosfer – Menambahkan rintik hujan ringan dan lapisan uap tipis.

Sebuah pengujian “kontrol langsung” menggabungkan ketiga instruksi tersebut dalam satu perintah (prompt), membiarkan AI menghasilkan klip akhir dalam satu kali proses.

Bagaimana konsistensi dinilai

Dua belas kriteria membentuk lembar penilaian, yang dikelompokkan ke dalam empat tema:

  • Stabilitas karakter – Wajah, rambut, dan pakaian tetap identik.
  • Stabilitas adegan – Sudut kamera dan posisi subjek tetap tetap.
  • Presisi pengeditan – AI mengikuti instruksi tanpa mengubah hal lainnya.
  • Kualitas temporal – Tidak ada kedipan (flicker), distorsi (warping), atau getaran (jitter) yang muncul selama gerakan.

Setiap klip dievaluasi pada bingkai pertama, titik tengah dari dua langkah berjalan, dan bingkai terakhir. Penilaian tersebut menunjukkan pola yang jelas.

Apa yang dikatakan angka-angka tersebut

Ketika pengeditan ditumpuk, AI dievaluasi menggunakan lembar penilaian tersebut. Kontrol perintah tunggal menerima evaluasi yang sama.

Siapa yang menang dan siapa yang kalah

Studio yang mampu menggunakan satu perintah yang komprehensif akan mendapatkan alur kerja yang lebih lancar. Pengembang sistem video generatif menghadapi hambatan teknik yang nyata—kebutuhan untuk menjaga representasi laten subjek yang stabil di seluruh transformasi berurutan.

Argumen tandingan

Beberapa pengguna berpendapat bahwa pengeditan bertahap menawarkan kontrol kreatif yang lebih besar. Dengan menyesuaikan satu elemen pada satu waktu, mereka dapat menyempurnakan setiap lapisan sebelum melanjutkan. Pengujian ini menunjukkan bahwa fleksibilitas tersebut mengorbankan fidelitas visual. Jika seorang kreator menerima perubahan kecil pada subjek demi kontrol yang mendetail, alur kerja Gemini Omni saat ini mungkin masih layak digunakan.

Apa yang perlu diperhatikan selanjutnya

  • Penyempurnaan model yang mengunci kode laten subjek di seluruh perintah.
  • Loop umpan balik pengguna yang memungkinkan kreator menandai adanya drift dan meminta “re-anchor” (penambatan ulang) pada subjek.

Kesimpulan

Gemini Omni dapat menghasilkan video multi-elemen yang apik ketika diberikan satu set instruksi lengkap sekaligus, tetapi fidelitas subjeknya menurun ketika pengeditan dilakukan secara bertumpuk.