Black Forest Labs از Flux 3 رونمایی کرد: جهشی چندوجهی در ویدیو و صدا

Black Forest Labs (BFL) با انتشار Flux 3، رسماً وارد مرزهای «مدل‌های جهان» (world models) شده است؛ یک مدل پایه چندوجهی (multimodal foundation model) که برای پر کردن شکاف میان تولید دیجیتال و هوش فیزیکی طراحی شده است. Flux 3 با آموزش هم‌زمان بر روی تصاویر، ویدیو و صدا، به سطحی از انسجام حسی دست می‌یابد که مدل‌های تک‌وجهی سنتی در بازسازی آن با دشواری روبرو هستند.

قدرت آموزش چندوجهی و صدای بومی (Native Audio)

برخلاف نسل‌های قبلی مدل‌های ویدئویی که اغلب برای همگام‌سازی صدا به فرآیندهای جداگانه نیاز دارند، Flux 3 قابلیت تولید صدای بومی را برای کلیپ‌های ویدئویی تا ۲۰ ثانیه معرفی می‌کند. این پیشرفت ریشه در فلسفه BFL دارد که هیچ وجه واحدی نمی‌تواند واقعیت را به طور کامل ثبت کند. در حالی که تصاویر ساختار مکانی و ویدیو تغییرات زمانی را فراهم می‌کنند، صدا پیوندهای علی (causal links) بین رویدادهای مکانیکی و صداهای آن‌ها را آشکار می‌سازد.

این مدل با بهره‌گیری از یک ترنسفورمر چندوجهی مبتنی بر رویکرد اختصاصی "Self-Flow" متعلق به BFL، تصاویر، ویدیو، صدا و حتی اقدامات (actions) را به یک بازنمایی داخلی مشترک تبدیل می‌کند. این آموزش یکپارچه به مدل اجازه می‌دهد تا شکاف‌های اطلاعاتی را پر کند؛ برای مثال، از نشانه‌های صوتی برای درک بهتر فیزیک یک حرکت بصری استفاده می‌کند. Flux 3 طیف گسترده‌ای از ویژگی‌های پیشرفته، از جمله text-to-video، image-to-video، انتقال‌های مبتنی بر کلید صحنه (keyframe-based transitions) و حتی دیالوگ‌های چندزبانه را پشتیبانی می‌کند.

ارزیابی Flux 3 در برابر غول‌های صنعت

در ارزیابی‌های اولیه با استفاده از کلیپ‌های ۱۰ ثانیه‌ای با رزولوشن 720p، Flux 3 مزیت‌های رقابتی قابل توجهی از خود نشان داد. در تست‌های مستقیم ترجیح کاربر، BFL گزارش داد که Flux 3 در ۹۳٪ مقایسه‌ها نسبت به Luma Ray 3.2 و در ۷۷٪ موارد نسبت به Runway Gen-4.5 برتری داشته است.

اگرچه فاصله با رقبای نخبه کمتر شده است، اما Flux 3 همچنان بر Grok Imagine Video (۶۹٪) و Kling v3 Pro (۶۰٪) پیشی گرفته است. این مدل همچنین با نرخ ترجیح ۵۲٪، از Seedance 2.0 و Gemini Omni Flash عملکرد بهتری داشت. این نتایج نشان می‌دهد که Flux 3 خود را در بالاترین سطح مدل‌های ویدئویی مولد قرار می‌دهد و قادر است با سیستم‌هایی که هم‌اکنون در جریان‌های کاری حرفه‌ای هالیوود ادغام شده‌اند، رقابت کند.

فراتر از تولید محتوا: حرکت به سوی رباتیک

شاید جاه‌طلبانه‌ترین جنبه Flux 3، حرکت آن به سمت «هوش بصری در دنیای واقعی» باشد. BFL صرفاً در حال ساخت یک ابزار خلاقانه نیست؛ آن‌ها در حال ساخت مدلی هستند که می‌تواند ادراک کند، پیش‌بینی کند و عمل کند. از طریق یک مؤلفه اختصاصیِ «عمل» (action) در معماری ترنسفورمر خود، از این مدل برای توسعه "Flux-mimic"، یک مدل ویدیو-عمل (video-action model)، استفاده می‌شود.

در یک کاربرد واقعی و حساس، BFL با Mimic Robotics همکاری کرده است تا این فناوری را در وظایف تولیدی در Audi آزمایش کند. این امر نشان می‌دهد که معماری زیربنایی Flux 3 با هدف خدمت به عنوان پایه‌ای برای رباتیک طراحی شده است؛ جایی که درک قوانین فیزیکی جهان به اندازه تولید یک ویدیوی با کیفیت بالا (high-fidelity) اهمیت دارد.

استقرار و وعده دسترسی به وزن‌های باز در "Flux 3 Dev"

BFL برای اطمینان از ایمنی و جمع‌آوری بازخورد کاربران، استراتژی عرضه مرحله‌ای را در پیش گرفته است. Flux 3 Video در حال حاضر در دسترس است و انتظار می‌رود Flux 3 Image طی چند هفته آینده در مرحله دسترسی اولیه (early access) عرضه شود. با نگاهی به آینده، BFL متعهد شده است که دسترسی به وزن‌های باز (open-weight) هسته چندوجهی خود را تحت عنوان "Flux 3 Dev" منتشر کند؛ اقدامی که احتمالاً توسعه‌دهندگان و پژوهشگران را در سراسر جهان برای ساختن بر پایه معماری آن‌ها توانمند می‌سازد.

نکات کلیدی

  • چندوجهی بومی (Native Multimodality): Flux 3 آموزش تصویر، ویدیو و صدا را در یک ترنسفورمر واحد "Self-Flow" ادغام می‌کند که امکان تولید ویدیوهای ۲۰ ثانیه‌ای با صدای بومی همگام‌سازی شده را فراهم می‌سازد.
  • عملکرد سطح بالا: در آزمایش‌های اولیه، Flux 3 از رقبای اصلی خود از جمله Luma Ray 3.2 (با ۹۳٪ ترجیح) و Runway Gen-4.5 (با ۷۷٪ ترجیح) پیشی گرفت.
  • ادغام با رباتیک: این مدل شامل یک مؤلفه پیش‌بینی عمل است که در حال حاضر برای وظایف رباتیک تولیدی در Audi از طریق Mimic Robotics در حال آزمایش است.