Google DeepMind đã công bố GenCeption, một mô hình biến bộ tạo video từ văn bản thành một mô hình nền tảng duy nhất cho một loạt các tác vụ thị giác, chỉ với 7.500 video tổng hợp. Khẳng định đưa ra rất đơn giản: một bộ tạo video vốn đã biết cách các vật thể di chuyển và tương tác có thể được tái sử dụng để dự đoán độ sâu, pháp tuyến bề mặt, mặt nạ phân đoạn và tư thế 3D mà không cần xây dựng một mạng riêng biệt cho mỗi tác vụ.
Từ các quy trình thị giác rời rạc đến một mô hình thống nhất
Các mô hình ngôn ngữ lớn trở nên linh hoạt nhờ việc học cách dự đoán từ tiếp theo. Ngược lại, nghiên cứu thị giác máy tính vẫn đang phải xoay xở với các hệ thống chuyên biệt—một hệ thống cho phân đoạn, một hệ thống khác cho độ sâu, và một hệ thống khác nữa cho tư thế. GenCeption bỏ qua sự chắp vá đó. Một câu lệnh văn bản sẽ cho mô hình biết cần tạo ra đầu ra nào, và cùng một kiến trúc 14 tỷ tham số đó sẽ cung cấp bản đồ độ sâu, bản đồ pháp tuyến, mặt nạ phân đoạn hoặc dự đoán các điểm chốt (keypoint). Bằng cách coi mọi đầu ra là một hình ảnh RGB ba kênh tiêu chuẩn, hệ thống giữ cho quy trình luôn đồng nhất; đối với các tác vụ không tự nhiên tạo ra hình ảnh, các nhà nghiên cứu đã thêm vào các mô-đun nhỏ có thể huấn luyện được.
Huấn luyện trên một tập dữ liệu tổng hợp cực nhỏ
Nhóm nghiên cứu đã xây dựng một tập dữ liệu tổng hợp trong Blender, kết xuất 7.500 video ngắn từ 800 mô hình người kỹ thuật số được điều khiển bởi 200 chuỗi bắt chuyển động. Các mô hình tạo video truyền thống như D4RT hoặc VGGT Omega huấn luyện trên hàng triệu clip; GenCeption đạt được hiệu suất tương đương hoặc tốt hơn trong khi chỉ tiêu thụ lượng dữ liệu bằng 1/7 đến 1/500 so với mức đó. Các điểm chuẩn (benchmarks) được báo cáo bao gồm:
- Ước tính độ sâu ngang ngửa với các mô hình chuyên dụng như DepthAnything 3.
- Dự đoán pháp tuyến bề mặt vượt qua NormalCrafter và Lotus-2.
- Nhận dạng tư thế 3D vượt trội hơn Genmo và TRAM.
- Phân đoạn hướng dẫn bằng ngôn ngữ tương đương với sức mạnh kết hợp của SAM 3 từ Meta và Gemini 3.5 Flash.
Các tác giả cho biết mục tiêu tạo sinh buộc mạng lưới phải nội tại hóa hình học và vật lý của cảnh, từ đó chuyển đổi sang các tác vụ nhận thức hạ nguồn.
Các lối tắt về kiến trúc để tăng tốc độ
GenCeption được xây dựng dựa trên mô hình video mã nguồn mở Wan2.1 của Alibaba. Thay vì quy trình khuếch tán (diffusion) thông thường vốn tinh chỉnh các khung hình qua nhiều lần lặp, các nhà nghiên cứu đã tái thiết kế hệ thống để đưa ra dự đoán chỉ trong một lượt truyền thẳng (forward pass) duy nhất. Kết quả là: mô hình xử lý một đoạn clip 81 khung hình trong khoảng mười giây trên phần cứng hiện tại. Kích thước 14 tỷ tham số vẫn là lớn, nhưng việc tiết kiệm chi phí huấn luyện và loại bỏ nhiều mạng chuyên biệt cho từng tác vụ đã mang lại hiệu quả vượt trội.
Tại sao cộng đồng AI nên chú ý
Nếu một bộ tạo video có thể đóng vai trò như một "mô hình thế giới" (world model)—một sự biểu diễn nắm bắt cách các vật thể chiếm lĩnh không gian và di chuyển theo thời gian—thì bước nhảy vọt tiếp theo trong AI thị giác có thể đến từ việc mở rộng khả năng tạo sinh thay vì gán nhãn các tập dữ liệu ngày càng lớn hơn. Một mô hình duy nhất được điều khiển bằng câu lệnh có thể đơn giản hóa các quy trình sản phẩm, cắt giảm chi phí kỹ thuật và hạ thấp rào cản cho các nhà phát triển cần các tính năng thị giác nhưng thiếu nguồn lực để huấn luyện nhiều mạng chuyên biệt.
Những lưu ý và câu hỏi chưa có lời giải
Các con số hiệu suất đến từ dữ liệu tổng hợp và các bộ tiêu chuẩn đánh giá, vốn có thể không phản ánh được sự hỗn loạn của các cảnh quay trong thế giới thực. Khả năng tổng quát hóa đối với ánh sáng, thời tiết hoặc chuyển động camera không được kiểm soát vẫn chưa được chứng minh. Việc suy luận mất mười giây cho một đoạn clip 81 khung hình, dù nhanh hơn phương pháp khuếch tán lặp đi lặp lại, vẫn còn lâu mới đạt đến mức thời gian thực cho robot hoặc AR. Hơn nữa, 14 tỷ tham số của mô hình đòi hỏi một ngân sách tính toán đáng kể để triển khai, điều này có thể hạn chế khả năng tiếp cận bên ngoài các phòng thí nghiệm được tài trợ tốt.
Những điều cần theo dõi tiếp theo
- Xác thực trong thế giới thực: các nghiên cứu kiểm tra GenCeption trên video lái xe ngoài trời, cảnh quay từ điện thoại cầm tay hoặc các cảnh kiểm tra công nghiệp.
- Mở rộng mô hình: liệu các phiên bản lớn hơn hoặc được huấn luyện hiệu quả hơn có thể thu hẹp khoảng cách về độ trễ trong khi vẫn duy trì hiệu quả về dữ liệu hay không.
- Lộ trình tích hợp: cách các nhà cung cấp đám mây hoặc nền tảng edge-AI có thể cung cấp một API duy nhất chấp nhận mô tả tác vụ bằng văn bản và trả về đầu ra thị giác phù hợp.
- Các nguồn huấn luyện thay thế: các nỗ lực kết hợp các clip tổng hợp với một lượng video thực tế vừa phải để cải thiện tính mạnh mẽ.
Điểm mấu chốt
GenCeption cho thấy một công cụ tạo video có thể đóng vai trò kép như một mô hình nền tảng thị giác đa nhiệm, cung cấp các kết quả về độ sâu, pháp tuyến, tư thế và phân đoạn ở mức tiên tiến nhất, trong khi chỉ cần học từ một tập dữ liệu nhỏ hơn nhiều bậc so với các phương pháp truyền thống. Tiềm năng của nó nằm ở việc hợp nhất một loạt các mạng chuyên dụng thành một hệ thống duy nhất được điều khiển bằng câu lệnh (prompt); thử thách tiếp theo sẽ là liệu tiềm năng đó có trụ vững được khi bước ra khỏi các phòng thí nghiệm mô phỏng để tiến vào thế giới thực đầy biến động hay không.
