Black Forest Labs dévoile Flux 3 : un bond multimodal dans la vidéo et l'audio
Black Forest Labs (BFL) a officiellement franchi la frontière des « modèles de monde » (world models) avec la sortie de Flux 3, un modèle de fondation multimodal conçu pour combler le fossé entre la génération numérique et l'intelligence physique. En s'entraînant simultanément sur des images, de la vidéo et de l'audio, Flux 3 atteint un niveau de cohésion sensorielle que les modèles traditionnels à modalité unique peinent à reproduire.
La puissance de l'entraînement multimodal et de l'audio natif
Contrairement aux générations précédentes de modèles vidéo qui nécessitent souvent des processus distincts pour synchroniser le son, Flux 3 introduit une génération audio native pour des clips vidéo allant jusqu'à 20 secondes. Ce développement s'appuie sur la philosophie de BFL selon laquelle aucune modalité unique ne peut capturer la réalité dans sa globalité. Alors que les images fournissent une structure spatiale et la vidéo des changements temporels, l'audio révèle les liens de causalité entre les événements mécaniques et leurs sons.
En utilisant un transformer multimodal basé sur l'approche propriétaire « Self-Flow » de BFL, le modèle convertit les images, la vidéo, l'audio et même les actions en une représentation interne partagée. Cet entraînement unifié permet au modèle de combler les lacunes informationnelles — par exemple, en utilisant des indices audio pour mieux comprendre la physique d'un mouvement visuel. Flux 3 prend en charge un large éventail de fonctionnalités avancées, notamment le text-to-video, l'image-to-video, les transitions basées sur des images clés (keyframes) et même le dialogue multilingue.
Benchmarking de Flux 3 face aux géants de l'industrie
Lors d'évaluations préliminaires utilisant des clips de 10 secondes en résolution 720p, Flux 3 a démontré des avantages concurrentiels significatifs. Dans des tests de préférence utilisateur en tête-à-tête, BFL a rapporté que Flux 3 était préféré à Luma Ray 3.2 dans 93 % des comparaisons et à Runway Gen-4.5 dans 77 % des cas.
Bien que les marges se resserrent face aux concurrents d'élite, Flux 3 conserve une avance sur Grok Imagine Video (69 %) et Kling v3 Pro (60 %). Il a également surpassé Seedance 2.0 et Gemini Omni Flash avec un taux de préférence de 52 %. Ces résultats suggèrent que Flux 3 se positionne au sommet de la hiérarchie des modèles vidéo génératifs, capable de rivaliser avec des systèmes déjà intégrés dans les flux de travail professionnels de Hollywood.
Au-delà de la création de contenu : vers la robotique
L'aspect peut-être le plus ambitieux de Flux 3 est son évolution vers une « intelligence visuelle du monde réel ». BFL ne se contente pas de construire un outil créatif ; ils développent un modèle capable de percevoir, de prédire et d'agir. Grâce à un composant d'action dédié au sein de son architecture transformer, le modèle est utilisé pour développer « Flux-mimic », un modèle vidéo-action.
Dans une application concrète à enjeux élevés, BFL s'est associé à Mimic Robotics pour tester cette technologie sur des tâches de production chez Audi. Cela indique que l'architecture sous-jacente de Flux 3 est destinée à servir de fondation pour la robotique, où la compréhension des lois physiques du monde est tout aussi importante que la génération d'une vidéo haute fidélité.
Déploiement et promesse des poids ouverts « Flux 3 Dev »
BFL adopte une stratégie de déploiement progressif pour garantir la sécurité et recueillir les commentaires des utilisateurs. Flux 3 Video est actuellement disponible, tandis que le lancement en accès anticipé de Flux 3 Image est prévu dans les prochaines semaines. Plus loin dans le futur, BFL s'est engagé à proposer un accès en poids ouverts (open-weight) à l'architecture multimodale sous le nom de « Flux 3 Dev », une initiative qui permettra probablement aux développeurs et chercheurs du monde entier de s'appuyer sur leur architecture.
Points clés à retenir
- Multimodalité native : Flux 3 intègre l'entraînement sur l'image, la vidéo et l'audio dans un seul transformer « Self-Flow », permettant de créer des vidéos de 20 secondes avec un audio natif synchronisé.
- Performance de premier plan : Lors des premiers tests, Flux 3 a surpassé ses principaux rivaux, notamment Luma Ray 3.2 (93 % de préférence) et Runway Gen-4.5 (77 % de préférence).
- Intégration robotique : Le modèle inclut un composant de prédiction d'action actuellement testé pour des tâches de robotique de production chez Audi via Mimic Robotics.
