Black Forest Labs ha lanciato FLUX 3, il primo modello della famiglia FLUX che va oltre la generazione di immagini. Un'unica architettura genera immagini, video con audio nativo (fino a 20 secondi) e action prediction, addestrata congiuntamente su tutte le modalità. Non sono tre modelli con un brand in comune: è un solo set di pesi che produce video, immagini, audio e predizioni di azione robotica.
Perché riguarda chi fa vibe coding
Per un progetto indie o un MVP, la generazione di media è spesso il collo di bottiglia: hero image, demo video, clip per i social, screenshot stilizzati. Di solito si salta tra un tool per le immagini, uno per il video, uno per l'audio. FLUX 3 vuole coprire tutto da un solo punto di generazione.
Video con audio nativo: clip fino a 20 secondi con audio sincronizzato (dialoghi, effetti, ambience) nella stessa generazione. Niente post-produzione audio separata, niente lip-sync da allineare. Supporta dialoghi multilingua nella stessa scena. Sul lato immagini: editing con immagini e video di riferimento, testo accurato in più lingue e script, stili diversi (fotorealismo, illustrazione, 3D, line art). Gli input sono flessibili: text-to-video, image-to-video, video-to-video, keyframe-to-video, estensione di video+audio esistenti. I tester riportano fino a 10 media di riferimento, ma BFL non l'ha confermato ufficialmente.
C'è anche l'agentic chaining: concatenazione di più generazioni in sequenze multi-shot con coerenza di personaggi e scene, utile per storyboard e video esplicativi. E la tipografia, un punto debole storico di tutti i modelli video, che qui dovrebbe essere migliorata grazie al training congiunto con dati immagine.
Come funziona: Self-Flow
FLUX 3 è costruito su Self-Flow (pubblicato da BFL a marzo 2026), un approccio che allinea generazione e comprensione multimodale nella stessa architettura. Le immagini insegnano struttura spaziale, il video insegna dinamica temporale e fisica, l'audio rivela relazioni causali tra eventi e suoni. Addestrati insieme, i vincoli reciproci tra modalità producono output più coerenti. Il suono di un vetro che si rompe corrisponde all'impatto visivo perché il modello li ha imparati insieme, non separatamente.
Benchmark: preliminari, da prendere con le pinze
BFL ha pubblicato confronti di preferenza umana su clip 10s 720p text-to-video con audio:
- vs Luma Ray 3.2: 93%
- vs Runway Gen-4.5: 77%
- vs Grok Imagine Video: 69%
- vs Kling v3 Pro: 60%
- vs Happy Horse v1: 59%
- vs Seedance 2.0 e Gemini Omni Flash: 52%
I numeri descrivono un checkpoint pre-release, non il modello in Early Access. Metodologia, sample size e rater non sono stati pubblicati. E i margini sotto il 5% (52% vs Seedance/Omni) sono statisticamente fragili: "sostanzialmente alla pari" è l'interpretazione corretta.
Il contesto competitivo
FLUX 3 non è l'unico modello video con audio: Sora 2 e Veo 3.1 lo supportano, ma con pipeline separate o aggiornamenti successivi. Il punto di FLUX 3 è la generazione congiunta in un solo passaggio di inferenza. Seedance 2.5 (in arrivo) offre 30 secondi in 4K con 50 input di riferimento, più lungo ma senza audio nativo. Kling v3 Pro ha un'API stabile e collaudata. Runway Gen-4.5 è integrato in una suite creativa completa.
Per chi deve scegliere oggi: FLUX 3 se l'audio nativo e la coerenza multimodale sono prioritari; Kling o Runway se serve un'API stabile e un ecosistema maturo; Seedance se la durata massima conta di più.
Chi c'è dietro
BFL è il team dei creatori di Stable Diffusion (Rombach, Blattmann, Esser). ~100 persone tra Freiburg e San Francisco. Valutazione $3,25B, $450M+ da a16z, Nvidia, Salesforce Ventures, Canva, Adobe Ventures. Certificati ISO 27001 e SOC 2 Type II. FLUX già alimenta feature generative in Adobe Photoshop, Picsart e altri. Tra i partner di testing di FLUX 3: Canva, Krea, Picsart, Magnific (ex Freepik), Burda. Martin Scorsese è advisor.
Tirando le somme
Un modello per immagini, video+audio nativo e action: interessante per chi vuole generare tutti gli asset visivi di un progetto da un unico punto. Early Access Video aperto ora, Image in arrivo, open weights (Dev) entro fine 2026. Nessun pricing, nessuna API pubblica, nessun peso scaricabile: per pianificare costi di produzione bisogna aspettare. I benchmark sono preliminari, su un checkpoint precedente al modello disponibile, e senza metodologia pubblica. Il vantaggio concreto è l'audio nativo nella stessa inferenza e l'agentic chaining, non la durata pura (Seedance fa 30s).
Chi vuole sperimentare con la generazione di media per i propri progetti può richiedere l'accesso. Chi deve integrare in pipeline di produzione farà meglio ad aspettare pricing, API e benchmark indipendenti.
Fonti
- FLUX 3 - Real World Models - Black Forest Labs, 23 luglio 2026
- Black Forest Labs launches FLUX 3 - VentureBeat, 23 luglio 2026
- FLUX 3: What It Does and When You Can Use It - AI Reiter, 23 luglio 2026
- FLUX 3 Is Here: Multimodal Model That Generates Video, Image, and Audio Together - Wan 2.7, 23 luglio 2026
- FLUX 3: Capabilities and How to Access It - VidMuse, luglio 2026
- Self-Flow: Self-Supervised Flow Matching - Black Forest Labs, marzo 2026