Black Forest Labs از Flux 3 رونمایی کرد: جهشی چندوجهی در ویدیو و صدا
Black Forest Labs (BFL) با انتشار Flux 3، رسماً وارد مرزهای «مدلهای جهان» (world models) شده است؛ یک مدل پایه چندوجهی (multimodal foundation model) که برای پر کردن شکاف میان تولید دیجیتال و هوش فیزیکی طراحی شده است. Flux 3 با آموزش همزمان بر روی تصاویر، ویدیو و صدا، به سطحی از انسجام حسی دست مییابد که مدلهای تکوجهی سنتی در بازسازی آن با دشواری روبرو هستند.
قدرت آموزش چندوجهی و صدای بومی (Native Audio)
برخلاف نسلهای قبلی مدلهای ویدئویی که اغلب برای همگامسازی صدا به فرآیندهای جداگانه نیاز دارند، Flux 3 قابلیت تولید صدای بومی را برای کلیپهای ویدئویی تا ۲۰ ثانیه معرفی میکند. این پیشرفت ریشه در فلسفه BFL دارد که هیچ وجه واحدی نمیتواند واقعیت را به طور کامل ثبت کند. در حالی که تصاویر ساختار مکانی و ویدیو تغییرات زمانی را فراهم میکنند، صدا پیوندهای علی (causal links) بین رویدادهای مکانیکی و صداهای آنها را آشکار میسازد.
این مدل با بهرهگیری از یک ترنسفورمر چندوجهی مبتنی بر رویکرد اختصاصی "Self-Flow" متعلق به BFL، تصاویر، ویدیو، صدا و حتی اقدامات (actions) را به یک بازنمایی داخلی مشترک تبدیل میکند. این آموزش یکپارچه به مدل اجازه میدهد تا شکافهای اطلاعاتی را پر کند؛ برای مثال، از نشانههای صوتی برای درک بهتر فیزیک یک حرکت بصری استفاده میکند. Flux 3 طیف گستردهای از ویژگیهای پیشرفته، از جمله text-to-video، image-to-video، انتقالهای مبتنی بر کلید صحنه (keyframe-based transitions) و حتی دیالوگهای چندزبانه را پشتیبانی میکند.
ارزیابی Flux 3 در برابر غولهای صنعت
در ارزیابیهای اولیه با استفاده از کلیپهای ۱۰ ثانیهای با رزولوشن 720p، Flux 3 مزیتهای رقابتی قابل توجهی از خود نشان داد. در تستهای مستقیم ترجیح کاربر، BFL گزارش داد که Flux 3 در ۹۳٪ مقایسهها نسبت به Luma Ray 3.2 و در ۷۷٪ موارد نسبت به Runway Gen-4.5 برتری داشته است.
اگرچه فاصله با رقبای نخبه کمتر شده است، اما Flux 3 همچنان بر Grok Imagine Video (۶۹٪) و Kling v3 Pro (۶۰٪) پیشی گرفته است. این مدل همچنین با نرخ ترجیح ۵۲٪، از Seedance 2.0 و Gemini Omni Flash عملکرد بهتری داشت. این نتایج نشان میدهد که Flux 3 خود را در بالاترین سطح مدلهای ویدئویی مولد قرار میدهد و قادر است با سیستمهایی که هماکنون در جریانهای کاری حرفهای هالیوود ادغام شدهاند، رقابت کند.
فراتر از تولید محتوا: حرکت به سوی رباتیک
شاید جاهطلبانهترین جنبه Flux 3، حرکت آن به سمت «هوش بصری در دنیای واقعی» باشد. BFL صرفاً در حال ساخت یک ابزار خلاقانه نیست؛ آنها در حال ساخت مدلی هستند که میتواند ادراک کند، پیشبینی کند و عمل کند. از طریق یک مؤلفه اختصاصیِ «عمل» (action) در معماری ترنسفورمر خود، از این مدل برای توسعه "Flux-mimic"، یک مدل ویدیو-عمل (video-action model)، استفاده میشود.
در یک کاربرد واقعی و حساس، BFL با Mimic Robotics همکاری کرده است تا این فناوری را در وظایف تولیدی در Audi آزمایش کند. این امر نشان میدهد که معماری زیربنایی Flux 3 با هدف خدمت به عنوان پایهای برای رباتیک طراحی شده است؛ جایی که درک قوانین فیزیکی جهان به اندازه تولید یک ویدیوی با کیفیت بالا (high-fidelity) اهمیت دارد.
استقرار و وعده دسترسی به وزنهای باز در "Flux 3 Dev"
BFL برای اطمینان از ایمنی و جمعآوری بازخورد کاربران، استراتژی عرضه مرحلهای را در پیش گرفته است. Flux 3 Video در حال حاضر در دسترس است و انتظار میرود Flux 3 Image طی چند هفته آینده در مرحله دسترسی اولیه (early access) عرضه شود. با نگاهی به آینده، BFL متعهد شده است که دسترسی به وزنهای باز (open-weight) هسته چندوجهی خود را تحت عنوان "Flux 3 Dev" منتشر کند؛ اقدامی که احتمالاً توسعهدهندگان و پژوهشگران را در سراسر جهان برای ساختن بر پایه معماری آنها توانمند میسازد.
نکات کلیدی
- چندوجهی بومی (Native Multimodality): Flux 3 آموزش تصویر، ویدیو و صدا را در یک ترنسفورمر واحد "Self-Flow" ادغام میکند که امکان تولید ویدیوهای ۲۰ ثانیهای با صدای بومی همگامسازی شده را فراهم میسازد.
- عملکرد سطح بالا: در آزمایشهای اولیه، Flux 3 از رقبای اصلی خود از جمله Luma Ray 3.2 (با ۹۳٪ ترجیح) و Runway Gen-4.5 (با ۷۷٪ ترجیح) پیشی گرفت.
- ادغام با رباتیک: این مدل شامل یک مؤلفه پیشبینی عمل است که در حال حاضر برای وظایف رباتیک تولیدی در Audi از طریق Mimic Robotics در حال آزمایش است.
