Black Forest Labs presenta Flux 3: un salto multimodale nel video e nell'audio

Black Forest Labs (BFL) è entrata ufficialmente nella frontiera dei "modelli del mondo" con il rilascio di Flux 3, un modello di base multimodale progettato per colmare il divario tra generazione digitale e intelligenza fisica. Addestrandosi simultaneamente su immagini, video e audio, Flux 3 raggiunge un livello di coesione sensoriale che i tradizionali modelli a singola modalità faticano a replicare.

La potenza dell'addestramento multimodale e dell'audio nativo

A differenza delle precedenti generazioni di modelli video, che spesso richiedono processi separati per sincronizzare il suono, Flux 3 introduce la generazione audio nativa per clip video della durata di un massimo di 20 secondi. Questo sviluppo affonda le radici nella filosofia di BFL secondo cui nessuna singola modalità può catturare appieno la realtà. Mentre le immagini forniscono la struttura spaziale e il video fornisce i cambiamenti temporali, l'audio rivela i legami causali tra gli eventi meccanici e i loro suoni.

Utilizzando un transformer multimodale basato sull'approccio proprietario "Self-Flow" di BFL, il modello converte immagini, video, audio e persino azioni in una rappresentazione interna condivisa. Questo addestramento unificato consente al modello di colmare le lacune informative; ad esempio, utilizzando segnali audio per comprendere meglio la fisica di un movimento visivo. Flux 3 supporta una vasta gamma di funzionalità avanzate, tra cui text-to-video, image-to-video, transizioni basate su keyframe e persino dialoghi multilingue.

Benchmarking di Flux 3 contro i giganti del settore

Nelle valutazioni preliminari effettuate utilizzando clip di 10 secondi a risoluzione 720p, Flux 3 ha dimostrato significativi vantaggi competitivi. Nei test di preferenza dell'utente testa a testa, BFL ha riferito che Flux 3 è stato preferito rispetto a Luma Ray 3.2 nel 93% dei confronti e rispetto a Runway Gen-4.5 nel 77% dei casi.

Sebbene i margini si restringano contro i competitor d'élite, Flux 3 mantiene comunque un vantaggio su Grok Imagine Video (69%) e Kling v3 Pro (60%). Ha inoltre superato Seedance 2.0 e Gemini Omni Flash con un tasso di preferenza del 52%. Questi risultati suggeriscono che Flux 3 si stia posizionando ai vertici dei modelli video generativi, capace di competere con sistemi che sono già integrati nei flussi di lavoro professionali di Hollywood.

Oltre la creazione di contenuti: verso la robotica

Forse l'aspetto più ambizioso di Flux 3 è il suo passo verso la "visual intelligence del mondo reale". BFL non sta solo costruendo uno strumento creativo; sta costruendo un modello in grado di percepire, prevedere e agire. Attraverso una componente di azione dedicata all'interno della sua architettura transformer, il modello viene utilizzato per sviluppare "Flux-mimic", un modello video-azione.

In un'applicazione del mondo reale ad alto rischio, BFL ha stretto una partnership con Mimic Robotics per testare questa tecnologia su compiti di produzione presso Audi. Ciò indica che l'architettura sottostante di Flux 3 è destinata a fungere da base per la robotica, dove la comprensione delle leggi fisiche del mondo è importante quanto la generazione di un video ad alta fedeltà.

Distribuzione e la promessa open-weight di "Flux 3 Dev"

BFL sta adottando una strategia di rilascio graduale per garantire la sicurezza e raccogliere i feedback degli utenti. Flux 3 Video è attualmente disponibile, mentre il lancio in accesso anticipato di Flux 3 Image è previsto entro le prossime settimane. Guardando più avanti, BFL si è impegnata a rilasciare l'accesso open-weight al backbone multimodale con il nome "Flux 3 Dev", una mossa che probabilmente permetterà a sviluppatori e ricercatori di tutto il mondo di costruire sulla propria architettura.

Punti chiave

  • Multimodalità nativa: Flux 3 integra l'addestramento su immagini, video e audio in un unico transformer "Self-Flow", consentendo video di 20 secondi con audio nativo sincronizzato.
  • Prestazioni di alto livello: Nei primi test, Flux 3 ha superato i principali rivali, tra cui Luma Ray 3.2 (93% di preferenza) e Runway Gen-4.5 (77% di preferenza).
  • Integrazione con la robotica: Il modello include una componente di previsione dell'azione attualmente in fase di test per compiti di robotica di produzione presso Audi tramite Mimic Robotics.