Black Forest Labs Ra Mắt Flux 3: Bước Nhảy Vọt Đa Phương Thức trong Video và Âm thanh

Black Forest Labs (BFL) đã chính thức tiến vào ranh giới của các "mô hình thế giới" (world models) với việc phát hành Flux 3, một mô hình nền tảng đa phương thức được thiết kế để thu hẹp khoảng cách giữa tạo lập kỹ thuật số và trí tuệ vật lý. Bằng cách huấn luyện đồng thời trên hình ảnh, video và âm thanh, Flux 3 đạt được mức độ gắn kết cảm giác mà các mô hình đơn phương thức truyền thống khó có thể sao chép.

Sức Mạnh của Huấn luyện Đa Phương thức và Âm thanh Bản địa

Không giống như các thế hệ mô hình video trước đây thường yêu cầu các quy trình riêng biệt để đồng bộ hóa âm thanh, Flux 3 giới thiệu khả năng tạo âm thanh bản địa cho các đoạn video dài lên đến 20 giây. Sự phát triển này bắt nguồn từ triết lý của BFL rằng không một phương thức đơn lẻ nào có thể nắm bắt trọn vẹn thực tế. Trong khi hình ảnh cung cấp cấu trúc không gian và video cung cấp các thay đổi theo thời gian, thì âm thanh tiết lộ các mối liên hệ nhân quả giữa các sự kiện cơ học và âm thanh của chúng.

Bằng cách sử dụng một transformer đa phương thức dựa trên phương pháp "Self-Flow" độc quyền của BFL, mô hình chuyển đổi hình ảnh, video, âm thanh và thậm chí cả các hành động thành một biểu diễn nội bộ chung. Quá trình huấn luyện thống nhất này cho phép mô hình lấp đầy các khoảng trống thông tin—ví dụ, sử dụng các tín hiệu âm thanh để hiểu rõ hơn về vật lý của một chuyển động trực quan. Flux 3 hỗ trợ một loạt các tính năng nâng cao, bao gồm text-to-video, image-to-video, chuyển cảnh dựa trên keyframe, và thậm chí cả đối thoại đa ngôn ngữ.

Đánh giá Hiệu năng của Flux 3 so với các Đối thủ Khổng lồ trong Ngành

Trong các đánh giá sơ bộ sử dụng các đoạn clip 10 giây ở độ phân giải 720p, Flux 3 đã chứng minh được những lợi thế cạnh tranh đáng kể. Trong các bài kiểm tra sở thích người dùng đối đầu trực tiếp, BFL báo cáo rằng Flux 3 được ưa chuộng hơn Luma Ray 3.2 trong 93% các lần so sánh và hơn Runway Gen-4.5 trong 77% trường hợp.

Mặc dù khoảng cách thu hẹp khi đối đầu với các đối thủ ưu tú, Flux 3 vẫn duy trì vị thế dẫn đầu trước Grok Imagine Video (69%) và Kling v3 Pro (60%). Nó cũng vượt qua Seedance 2.0 và Gemini Omni Flash với tỷ lệ ưa chuộng 52%. Những kết quả này cho thấy Flux 3 đang định vị mình ở phân khúc cao cấp nhất của các mô hình video tạo sinh, có khả năng cạnh tranh với các hệ thống vốn đã được tích hợp vào các quy trình làm việc chuyên nghiệp tại Hollywood.

Vượt xa khỏi Sáng tạo Nội dung: Hướng tới Robot học

Có lẽ khía cạnh tham vọng nhất của Flux 3 là bước tiến hướng tới "trí tuệ thị giác thế giới thực". BFL không chỉ đang xây dựng một công cụ sáng tạo; họ đang xây dựng một mô hình có thể nhận thức, dự đoán và hành động. Thông qua một thành phần hành động chuyên dụng trong kiến trúc transformer của mình, mô hình đang được sử dụng để phát triển "Flux-mimic", một mô hình video-hành động.

Trong một ứng dụng thực tế quan trọng, BFL đã hợp tác với Mimic Robotics để thử nghiệm công nghệ này trong các nhiệm vụ sản xuất tại Audi. Điều này cho thấy kiến trúc nền tảng của Flux 3 được dự định đóng vai trò là nền móng cho robot học, nơi việc hiểu các quy luật vật lý của thế giới cũng quan trọng như việc tạo ra một video có độ trung thực cao.

Triển khai và Lời hứa