Gemini Omni của Google, được truy cập thông qua giao diện Google Vids mới, đã trải qua một bài kiểm tra thực nghiệm trong phòng thí nghiệm để xem liệu AI có thể giữ cho một đối tượng (người giao hàng) ổn định sau ba lần chỉnh sửa video liên tiếp hay không.

Tại sao bài kiểm tra này lại quan trọng

Các công cụ tạo video bằng AI hứa hẹn rằng bất kỳ ai cũng có thể thay đổi nền, thêm ánh sáng hoặc rắc các hiệu ứng chỉ bằng một câu lệnh văn bản duy nhất. Đối với một nhà sáng tạo, lời hứa này rất đơn giản: bắt đầu với một đoạn clip thô, nhập “làm cho trời mưa vào ban đêm”, và nhận về một đoạn phim ngắn hoàn chỉnh. Hầu hết người dùng không thấy được cái giá tiềm ẩn của sự “trôi dạt” (drift) — sự mất mát dần dần về ngoại hình, tư thế hoặc chuyển động của đối tượng gốc khi AI diễn giải từng hướng dẫn mới. Nếu khuôn mặt của người giao hàng thay đổi một cách tinh vi sau lần chỉnh sửa thứ hai, tác phẩm cuối cùng sẽ trông thiếu chuyên nghiệp và có thể cần phải chỉnh sửa thủ công tốn kém.

Thí nghiệm

Clip gốc (Baseline clip) – Một cảnh quay trong studio với camera tĩnh, quay một người mặc áo khoác gió màu xanh navy, tay trái cầm một chiếc hộp carton nhỏ và bước hai bước về phía camera. Ánh sáng đồng đều, nền đơn giản và chuyển động nhẹ nhàng.

Chuỗi chỉnh sửa – Ba lần chỉnh sửa được áp dụng liên tiếp:

  1. Thay đổi nền – Thay thế studio bằng một con phố thành phố mưa vào ban đêm.
  2. Tinh chỉnh ánh sáng – Thêm ánh sáng viền màu xanh quanh người giao hàng và ánh sáng ấm áp từ cửa sổ một cửa hàng.
  3. Lớp bầu không khí – Thêm những hạt mưa nhẹ và một lớp hơi nước mỏng.

Một lượt chạy “kiểm soát trực tiếp” (direct control) đã kết hợp cả ba hướng dẫn vào một câu lệnh duy nhất, cho phép AI tạo ra clip cuối cùng trong một lần thực hiện.

Cách tính điểm độ nhất quán

Mười hai tiêu chí đã tạo nên bảng điểm, được nhóm thành bốn chủ đề:

  • Độ ổn định của nhân vật – Khuôn mặt, tóc và trang phục vẫn giữ nguyên.
  • Độ ổn định của cảnh quay – Góc máy và vị trí đối tượng được giữ cố định.
  • Độ chính xác của chỉnh sửa – AI tuân thủ hướng dẫn mà không làm thay đổi bất kỳ thứ gì khác.
  • Chất lượng thời gian (Temporal quality) – Không có hiện tượng nhấp nháy, biến dạng hoặc rung lắc xuất hiện trong quá trình chuyển động.

Mỗi clip được đánh giá tại khung hình đầu tiên, điểm giữa của hai bước đi và khung hình cuối cùng. Kết quả chấm điểm cho thấy một quy luật rõ ràng.

Những con số nói lên điều gì

Khi các lần chỉnh sửa được xếp chồng lên nhau, AI được đánh giá bằng bảng điểm. Lượt kiểm soát bằng câu lệnh đơn (single-prompt control) cũng nhận được đánh giá tương tự.

Ai thắng và ai thua

Các studio có khả năng sử dụng một câu lệnh duy nhất và toàn diện sẽ có quy trình làm việc mượt mà hơn. Các nhà phát triển hệ thống video tạo bằng AI đang đối mặt với một rào cản kỹ thuật rõ ràng — nhu cầu duy trì một biểu diễn tiềm ẩn (latent representation) ổn định của đối tượng qua các lần biến đổi liên tiếp.

Lập luận phản bác

Một số người dùng lập luận rằng chỉnh sửa từng bước (incremental editing) mang lại khả năng kiểm soát sáng tạo cao hơn. Bằng cách điều chỉnh từng yếu tố một, họ có thể tinh chỉnh từng lớp trước khi chuyển sang bước tiếp theo. Tuy nhiên, bài kiểm tra cho thấy sự linh hoạt này phải đánh đổi bằng độ trung thực về hình ảnh. Nếu một nhà sáng tạo chấp nhận những thay đổi nhỏ của đối tượng để đổi lấy sự kiểm soát chi tiết, quy trình làm việc hiện tại của Gemini Omni vẫn có thể khả thi.

Những điều cần theo dõi tiếp theo

  • Các cải tiến mô hình giúp khóa mã tiềm ẩn (latent code) của đối tượng qua các câu lệnh.
  • Vòng lặp phản hồi của người dùng cho phép các nhà sáng tạo đánh dấu sự "trôi dạt" và yêu cầu "neo lại" (re-anchor) đối tượng.

Kết luận rút ra

Gemini Omni có thể tạo ra một video hoàn chỉnh với nhiều yếu tố khi được cung cấp một bộ hướng dẫn đầy đủ cùng một lúc, nhưng độ trung thực của đối tượng sẽ bị giảm dần khi các lần chỉnh sửa được thực hiện chồng lên nhau.