Wan 3.0 hiện đã có thể ghép nối nửa phút phim do AI tạo ra mà không gặp tình trạng biến dạng khuôn mặt nhân vật hay rung lắc camera—một bước tiến đưa video tạo sinh từ những đoạn clip ngắn trở thành công cụ kể chuyện hữu dụng.
Sự đột phá này dựa trên một hệ thống liên kết chặt chẽ: một bộ tự mã hóa biến phân 3D nhân quả (causal 3-D variational auto-encoder - VAE) xử lý không gian và thời gian như một khối thống nhất, các mô hình transformer dựa trên khuếch tán (diffusion-based transformers) chuyển đổi khối đó thành các patch-token, và một bộ định tuyến hỗn hợp chuyên gia (mixture-of-experts router) giúp tách biệt việc lập kế hoạch ở cấp độ cảnh quay với việc tinh chỉnh ở cấp độ điểm ảnh. Wan 3.0 cũng chấp nhận văn bản, hình ảnh, âm thanh và video tham chiếu dưới dạng các luồng điều kiện độc lập, cho phép mỗi luồng tác động đến kết quả đầu ra mà không ghi đè lên các luồng khác. Kết quả là một thế giới nghe nhìn mạch lạc, nơi nhân vật có thể được theo dõi xuyên suốt một cú lia máy (pan), sản phẩm vẫn giữ nguyên hình dạng khi xoay tròn, và tiếng bước chân khớp chính xác với tín hiệu âm thanh.
Tại sao video AI thời lượng dài từng là một trở ngại lớn
Các mô hình video tạo sinh đời đầu có thể tạo ra vài giây hoạt ảnh, nhưng việc kéo dài thời lượng đã bộc lộ hai khiếm khuyết cơ bản. Thứ nhất, việc tổng hợp theo từng khung hình đã bỏ qua các phụ thuộc về mặt thời gian, khiến một khuôn mặt ban đầu trông rất thực tế dần trở nên biến dạng chỉ sau vài khung hình. Thứ hai, hầu hết các quy trình xử lý đều coi âm thanh là yếu tố phụ, dẫn đến việc khớp khẩu hình không chuẩn hoặc các hiệu ứng âm thanh Foley bị đặt sai chỗ. Việc khắc phục những vấn đề này bằng phương pháp lấy mẫu thô (brute-force sampling) khiến chi phí tăng vọt theo thời lượng, làm cho bất kỳ video nào dài hơn vài giây đều trở nên không khả thi đối với những người sáng tạo.
Các trụ cột kỹ thuật của Wan 3.0
Causal 3-D VAE – Các VAE truyền thống nén một hình ảnh duy nhất thành một mã tiềm ẩn (latent code). Phiên bản của Wan nén toàn bộ một khối video (chiều cao × chiều rộng × thời gian) cùng một lúc. Vì bộ mã hóa (encoder) và bộ giải mã (decoder) tuân thủ thứ tự nhân quả của các khung hình, nên biểu diễn tiềm ẩn đã mã hóa sẵn "điều gì sẽ xảy ra tiếp theo", cho phép các mô-đun hạ nguồn làm việc với một nền tảng có nhận thức về thời gian thay vì các hình ảnh rời rạc.
Diffusion Transformers – Sau khi mã hóa, video được chia thành các patch 3D đóng vai trò như các từ trong một câu. Một transformer sẽ dự đoán quỹ đạo khuếch tán cho từng patch, học cách các vật thể di chuyển, cách ánh sáng thay đổi và cách phối cảnh biến đổi qua các khung hình. Cách tiếp cận dựa trên token này mang lại cho mô hình cảm nhận chuyển động tổng thể trong khi vẫn xử lý được các chi tiết tinh vi.
Mixture-of-Experts (MoE) – Thay vì ép buộc một mạng duy nhất phải học cả bố cục vĩ mô và kết cấu vi mô, Wan điều hướng các bước khuếch tán ban đầu đến một "chuyên gia" tập trung vào bố cục cảnh quay và chuyển động rộng, sau đó chuyển các bước sau cho một chuyên gia thứ hai để tinh chỉnh lỗ chân lông, sự phản chiếu và các bóng đổ tinh tế. Sự phân tách này giúp tránh lãng phí tài nguyên tính toán cho các tác vụ không cần độ phân giải cao, giúp thời gian suy luận (inference time) ở mức có thể kiểm soát được.
Multimodal Conditioning – Các câu lệnh văn bản, hình ảnh tham chiếu, clip video ngắn và các bản nhạc đều tạo ra embedding riêng của chúng. Mô hình hợp nhất các embedding này trong khi vẫn bảo toàn tính riêng biệt của chúng, vì vậy một chỉ dẫn văn bản như “walk left” sẽ không xóa mất hình ảnh tham chiếu khuôn mặt nhân vật đã cung cấp, và một bản nhạc nền cũng sẽ không lấn át lời thoại.
Identity and Camera Control – Các đặc trưng tham chiếu được trích xuất từ hình ảnh hoặc clip được cung cấp sẽ đóng vai trò là mỏ neo trong suốt quá trình tạo video. Khi camera ảo lia máy, hệ thống xử lý chuyển động như một phép biến đổi hình học của không gian tiềm ẩn thay vì là một bộ lọc hậu kỳ, giúp giữ cho danh tính của đối tượng ổn định bất chấp sự thay đổi về góc nhìn hoặc ánh sáng.
Audiovisual Sync – Một đầu căn chỉnh (alignment head) chuyên dụng sẽ dự đoán thời điểm các sự kiện âm thanh xuất hiện trong luồng video. Tiếng bước chân, tiếng vỗ tay hoặc các tín hiệu đối thoại sẽ khớp chính xác vào các khung hình nơi dạng sóng âm thanh đạt đỉnh, tạo ra sự đồng bộ chặt chẽ giữa hình ảnh và âm thanh mà không cần chỉnh sửa thủ công.
Những ai sẽ được hưởng lợi
Những người sáng tạo nội dung, nhà quảng cáo và nhà phát triển trò chơi giờ đây có thể tạo nguyên mẫu cho các phân cảnh dài hơn mà không cần phải ghép nối hàng chục clip ngắn. Nhờ kiến trúc MoE cắt giảm các tính toán không cần thiết, chi phí cho mỗi phút video được tạo ra vẫn nằm trong tầm với của các studio quy mô vừa, những đơn vị trước đây vốn phải dựa vào các quy trình hoạt hình thủ công. Các nhà nghiên cứu cũng có thể tinh chỉnh không gian tiềm ẩn có thể tái sử dụng của causal 3-D VAE cho các tác vụ chuyên biệt như chẩn đoán hình ảnh y tế hoặc trực quan hóa khoa học.
Những đánh đổi và câu hỏi còn bỏ ngỏ
Sự tinh vi của kiến trúc này đi kèm với một cái giá về phần cứng: việc huấn luyện diffusion transformer trên các mảng 3D vẫn đòi hỏi các GPU cao cấp hoặc các bộ tăng tốc chuyên dụng. MoE giúp giảm lãng phí trong quá trình suy luận, nhưng logic định tuyến lại làm tăng độ trễ, điều có thể nhận thấy rõ trong các ứng dụng thời gian thực. Điều kiện đa phương thức, dù mạnh mẽ, có thể gây ra xung đột khi các câu lệnh (prompts) mơ hồ; mô hình có thể ưu tiên phương thức này hơn phương thức khác, dẫn đến sự sai lệch danh tính tinh vi trong các trường hợp biên.
Các nhà phê bình cũng lưu ý rằng một thế giới nhất quán không đảm bảo sự nhất quán về mặt cốt truyện. Wan 3.0 vượt trội về tính liên tục của hình ảnh và âm thanh, nhưng nó vẫn chưa hiểu được các mạch truyện, động lực nhân vật hay nhịp độ. Những yếu tố kể chuyện ở cấp độ cao hơn đó vẫn nằm trong tay các biên tập viên là con người.
Những điều cần theo dõi tiếp theo
Đội ngũ đứng sau Wan 3.0 đã gợi ý về một phiên bản sắp tới sẽ thử nghiệm với khuếch tán phân cấp (hierarchical diffusion), cho phép một lượt xử lý duy nhất thiết lập một kịch bản phân cảnh (storyboard) sơ bộ trước khi tinh chỉnh các chi tiết. Việc tích hợp với các bộ công cụ chỉnh sửa phổ biến cũng nằm trong lộ trình phát triển, điều này có thể biến nguyên mẫu nghiên cứu hiện tại thành một plug-in mà người dùng không chuyên về kỹ thuật cũng có thể sử dụng trực tiếp.
Nếu bản phát hành hiện tại chứng minh được sự ổn định trên nhiều loại phần cứng khác nhau, chúng ta có thể thấy một làn sóng các studio độc lập bỏ qua các thiết bị bắt chuyển động truyền thống, thay vào đó chỉ dựa vào một vài cảnh quay tham chiếu và một kịch bản văn bản để tạo ra các cảnh quay dài hoàn chỉnh. Vài tháng tới sẽ cho thấy liệu những bước tiến kỹ thuật này có chuyển hóa thành một sự thay đổi trong quy trình sản xuất hay chỉ dừng lại ở một sự tò mò tốn kém dành cho cộng đồng nghiên cứu.
