Black Forest Labs presenta Flux 3: un salto multimodal en vídeo y audio

Black Forest Labs (BFL) ha entrado oficialmente en la frontera de los "modelos de mundo" con el lanzamiento de Flux 3, un modelo fundacional multimodal diseñado para cerrar la brecha entre la generación digital y la inteligencia física. Al entrenarse simultáneamente con imágenes, vídeo y audio, Flux 3 logra un nivel de cohesión sensorial que los modelos tradicionales de una sola modalidad tienen dificultades para replicar.

El poder del entrenamiento multimodal y el audio nativo

A diferencia de las generaciones anteriores de modelos de vídeo, que a menudo requieren procesos separados para sincronizar el sonido, Flux 3 introduce la generación de audio nativo para clips de vídeo de hasta 20 segundos de duración. Este desarrollo tiene sus raíces en la filosofía de BFL de que ninguna modalidad por sí sola puede capturar la realidad en su totalidad. Mientras que las imágenes proporcionan la estructura espacial y el vídeo aporta los cambios temporales, el audio revela los vínculos causales entre los eventos mecánicos y sus sonidos.

Mediante el uso de un transformador multimodal basado en el enfoque patentado "Self-Flow" de BFL, el modelo convierte imágenes, vídeo, audio e incluso acciones en una representación interna compartida. Este entrenamiento unificado permite al modelo rellenar lagunas de información; por ejemplo, utilizando señales de audio para comprender mejor la física de un movimiento visual. Flux 3 admite una amplia gama de funciones avanzadas, que incluyen text-to-video, image-to-video, transiciones basadas en fotogramas clave (keyframes) e incluso diálogos multilingües.

Evaluación comparativa de Flux 3 frente a los gigantes de la industria

En evaluaciones preliminares utilizando clips de 10 segundos a una resolución de 720p, Flux 3 demostró ventajas competitivas significativas. En pruebas de preferencia de usuario cara a cara, BFL informó que Flux 3 fue preferido sobre Luma Ray 3.2 en el 93% de las comparaciones y sobre Runway Gen-4.5 en el 77% de los casos.

Aunque los márgenes se estrechan frente a competidores de élite, Flux 3 sigue manteniendo la delantera sobre Grok Imagine Video (69%) y Kling v3 Pro (60%). También superó a Seedance 2.0 y Gemini Omni Flash con una tasa de preferencia del 52%. Estos resultados sugieren que Flux 3 se está posicionando en el nivel más alto de los modelos de vídeo generativo, capaz de competir con sistemas que ya se están integrando en los flujos de trabajo profesionales de Hollywood.

Más allá de la creación de contenido: hacia la robótica

Quizás el aspecto más ambicioso de Flux 3 es su avance hacia la "inteligencia visual del mundo real". BFL no solo está construyendo una herramienta creativa; están construyendo un modelo que puede percibir, predecir y actuar. A través de un componente de acción dedicado dentro de su arquitectura de transformador, el modelo se está utilizando para desarrollar "Flux-mimic", un modelo de vídeo-acción.

En una aplicación del mundo real de gran importancia, BFL se ha asociado con Mimic Robotics para probar esta tecnología en tareas de producción en Audi. Esto indica que la arquitectura subyacente de Flux 3 tiene como objetivo servir de base para la robótica, donde comprender las leyes físicas del mundo es tan importante como generar un vídeo de alta fidelidad.

Despliegue y la promesa de pesos abiertos de "Flux 3 Dev"

BFL está adoptando una estrategia de despliegue por fases para garantizar la seguridad y recopilar comentarios de los usuarios. Flux 3 Video ya está disponible, y se espera que Flux 3 Image se lance en acceso anticipado en las próximas semanas. Mirando hacia el futuro, BFL se ha comprometido a lanzar el acceso de pesos abiertos (open-weight) al núcleo multimodal bajo el nombre "Flux 3 Dev", un movimiento que probablemente permitirá a desarrolladores e investigadores de todo el mundo construir sobre su arquitectura.

Conclusiones clave

  • Multimodalidad nativa: Flux 3 integra el entrenamiento de imagen, vídeo y audio en un único transformador "Self-Flow", lo que permite vídeos de 20 segundos con audio nativo sincronizado.
  • Rendimiento de primer nivel: En las primeras pruebas, Flux 3 superó a sus principales rivales, incluidos Luma Ray 3.2 (93% de preferencia) y Runway Gen-4.5 (77% de preferencia).
  • Integración con robótica: El modelo incluye un componente de predicción de acciones que actualmente se está probando para tareas de robótica de producción en Audi a través de Mimic Robotics.