Black Forest Labs Memperkenalkan Flux 3: Lonjakan Multimodal dalam Video dan Audio
Black Forest Labs (BFL) telah secara rasmi memasuki sempadan "model dunia" (world models) dengan pelancaran Flux 3, sebuah model asas multimodal yang direka untuk merapatkan jurang antara penjanaan digital dan kecerdasan fizikal. Dengan menjalani latihan pada imej, video, dan audio secara serentak, Flux 3 mencapai tahap kohesi deria yang sukar ditiru oleh model modaliti tunggal tradisional.
Kuasa Latihan Multimodal dan Audio Natif
Berbeza dengan generasi model video sebelumnya yang sering memerlukan proses berasingan untuk menyelaraskan bunyi, Flux 3 memperkenalkan penjanaan audio natif untuk klip video sehingga 20 saat panjangnya. Perkembangan ini berakar umbi dalam falsafah BFL bahawa tiada satu modaliti tunggal yang dapat merakam realiti sepenuhnya. Walaupun imej menyediakan struktur spatial dan video menyediakan perubahan temporal, audio mendedahkan hubungan kausal antara peristiwa mekanikal dan bunyinya.
Dengan menggunakan transformer multimodal berdasarkan pendekatan "Self-Flow" milik BFL, model ini menukarkan imej, video, audio, dan juga tindakan kepada representasi dalaman yang dikongsi. Latihan bersepadu ini membolehkan model mengisi jurang maklumat—sebagai contoh, menggunakan petunjuk audio untuk memahami fizik pergerakan visual dengan lebih baik. Flux 3 menyokong pelbagai ciri canggih, termasuk text-to-video, image-to-video, peralihan berasaskan bingkai utama (keyframe), dan juga dialog berbilang bahasa.
Penandaarasan Flux 3 Terhadap Gergasi Industri
Dalam penilaian awal menggunakan klip 10 saat pada resolusi 720p, Flux 3 menunjukkan kelebihan daya saing yang ketara. Dalam ujian pilihan pengguna secara langsung, BFL melaporkan bahawa Flux 3 lebih disukai berbanding Luma Ray 3.2 dalam 93% perbandingan dan berbanding Runway Gen-4.5 dalam 77% kes.
Walaupun jurang semakin mengecil berbanding pesaing elit, Flux 3 masih mengekalkan pendahuluan berbanding Grok Imagine Video (69%) dan Kling v3 Pro (60%). Ia juga mengatasi Seedance 2.0 dan Gemini Omni Flash dengan kadar pilihan sebanyak 52%. Keputusan ini menunjukkan bahawa Flux 3 sedang meletakkan dirinya di peringkat teratas model video generatif, yang mampu bersaing dengan sistem yang sudah pun diintegrasikan dalam aliran kerja profesional Hollywood.
Melangkaui Penciptaan Kandungan: Menuju ke Arah Robotik
Mungkin aspek yang paling bercita-cita tinggi bagi Flux 3 adalah langkahnya ke arah "kecerdasan visual dunia nyata." BFL bukan sekadar membina alat kreatif; mereka sedang membina model yang boleh merasai, meramal, dan bertindak. Melalui komponen tindakan khusus dalam seni bina transformernya, model ini sedang digunakan untuk membangunkan "Flux-mimic," sebuah model video-tindakan.
Dalam aplikasi dunia nyata yang berisiko tinggi, BFL telah bekerjasama dengan Mimic Robotics untuk menguji teknologi ini pada tugas-tugas pengeluaran di Audi. Ini menunjukkan bahawa seni bina asas Flux 3 bertujuan untuk berfungsi sebagai asas bagi robotik, di mana pemahaman tentang hukum fizik dunia adalah sama pentingnya dengan menjana video berkesetiaan tinggi (high-fidelity).
Pelancaran dan Janji "Flux 3 Dev" Open-Weight
BFL sedang mengguna pakai strategi pelancaran berfasa untuk memastikan keselamatan dan mengumpul maklum balas pengguna. Flux 3 Video kini tersedia, manakala Flux 3 Image dijangka akan dilancarkan dalam akses awal dalam masa beberapa minggu akan datang. Melihat lebih jauh ke hadapan, BFL telah komited untuk melepaskan akses open-weight kepada tulang belakang multimodal di bawah nama "Flux 3 Dev," satu langkah yang berkemungkinan besar akan memperkasakan pembangun dan penyelidik di seluruh dunia untuk membina berdasarkan seni bina mereka.
Ringkasan Utama
- Multimodaliti Natif: Flux 3 menyepadukan latihan imej, video, dan audio ke dalam satu transformer "Self-Flow" tunggal, membolehkan video 20 saat dengan audio natif yang selaras.
- Prestasi Tahap Atas: Dalam ujian awal, Flux 3 mengatasi pesaing utama termasuk Luma Ray 3.2 (93% pilihan) dan Runway Gen-4.5 (77% pilihan).
- Integrasi Robotik: Model ini merangkumi komponen ramalan tindakan yang kini sedang diuji untuk tugas robotik pengeluaran di Audi melalui Mimic Robotics.
