Black Forest Labs ने Flux 3 का अनावरण किया: वीडियो और ऑडियो में एक मल्टीमॉडल छलांग

Black Forest Labs (BFL) ने Flux 3 के रिलीज़ के साथ आधिकारिक तौर पर "world models" के क्षेत्र में प्रवेश कर लिया है। यह एक मल्टीमॉडल फाउंडेशन मॉडल है जिसे डिजिटल जनरेशन और भौतिक बुद्धिमत्ता (physical intelligence) के बीच के अंतर को पाटने के लिए डिज़ाइन किया गया है। इमेज, वीडियो और ऑडियो पर एक साथ प्रशिक्षण देकर, Flux 3 संवेदी सामंजस्य (sensory cohesion) का एक ऐसा स्तर प्राप्त करता है जिसे पारंपरिक सिंगल-मोडैलिटी मॉडल दोहराने में संघर्ष करते हैं।

मल्टीमॉडल ट्रेनिंग और नेटिव ऑडियो की शक्ति

वीडियो मॉडल की पिछली पीढ़ियों के विपरीत, जिन्हें अक्सर साउंड सिंक करने के लिए अलग प्रक्रियाओं की आवश्यकता होती है, Flux 3 20 सेकंड तक लंबे वीडियो क्लिप्स के लिए नेटिव ऑडियो जनरेशन पेश करता है। यह विकास BFL के इस दर्शन पर आधारित है कि कोई भी एकल मोडैलिटी वास्तविकता को पूरी तरह से नहीं पकड़ सकती। जहाँ इमेज स्थानिक संरचना (spatial structure) प्रदान करती हैं और वीडियो कालिक परिवर्तन (temporal changes) प्रदान करता है, वहीं ऑडियो यांत्रिक घटनाओं और उनकी आवाज़ों के बीच के कारण संबंधी संबंधों (causal links) को प्रकट करता है।

BFL के प्रोप्रायटरी "Self-Flow" दृष्टिकोण पर आधारित एक मल्टीमॉडल ट्रांसफॉर्मर का उपयोग करके, यह मॉडल इमेज, वीडियो, ऑडियो और यहाँ तक कि क्रियाओं (actions) को एक साझा आंतरिक प्रतिनिधित्व (internal representation) में बदल देता है। यह एकीकृत प्रशिक्षण मॉडल को सूचनात्मक अंतराल को भरने की अनुमति देता है—उदाहरण के लिए, किसी दृश्य गति के भौतिक विज्ञान (physics) को बेहतर ढंग से समझने के लिए ऑडियो संकेतों का उपयोग करना। Flux 3 उन्नत सुविधाओं की एक विस्तृत श्रृंखला का समर्थन करता है, जिसमें text-to-video, image-to-video, keyframe-आधारित ट्रांज़िशन और यहाँ तक कि बहुभाषी संवाद भी शामिल हैं।

इंडस्ट्री दिग्गजों के मुकाबले Flux 3 का बेंचमार्किंग

720p रिज़ॉल्यूशन पर 10-सेकंड के क्लिप्स का उपयोग करते हुए प्रारंभिक मूल्यांकन में, Flux 3 ने महत्वपूर्ण प्रतिस्पर्धी लाभ प्रदर्शित किए। आमने-सामने के यूजर प्रेफरेंस टेस्ट में, BFL ने बताया कि 93% तुलनाओं में Flux 3 को Luma Ray 3.2 की तुलना में और 77% मामलों में Runway Gen-4.5 की तुलना में अधिक पसंद किया गया।

हालांकि एलीट प्रतिस्पर्धियों के मुकाबले अंतर कम है, फिर भी Flux 3 ने Grok Imagine Video (69%) और Kling v3 Pro (60%) पर बढ़त बनाए रखी। इसने 52% प्रेफरेंस रेट के साथ Seedance 2.0 और Gemini Omni Flash को भी पीछे छोड़ दिया। ये परिणाम बताते हैं कि Flux 3 खुद को जनरेटिव वीडियो मॉडल के शीर्ष स्तर पर स्थापित कर रहा है, जो उन सिस्टमों के साथ प्रतिस्पर्धा करने में सक्षम है जो पहले से ही पेशेवर हॉलीवुड वर्कफ़्लो में एकीकृत हो रहे हैं।

कंटेंट क्रिएशन से परे: रोबोटिक्स की ओर कदम

शायद Flux 3 का सबसे महत्वाकांक्षी पहलू "real-world visual intelligence" की ओर इसका कदम है। BFL केवल एक रचनात्मक उपकरण नहीं बना रहा है; वे एक ऐसा मॉडल बना रहे हैं जो देख सकता है, अनुमान लगा सकता है और कार्य कर सकता है। अपने ट्रांसफॉर्मर आर्किटेक्चर के भीतर एक समर्पित एक्शन कंपोनेंट के माध्यम से, इस मॉडल का उपयोग "Flux-mimic" विकसित करने के लिए किया जा रहा है, जो एक वीडियो-एक्शन मॉडल है।

एक हाई-स्टेक्स रियल-वर्ल्ड एप्लिकेशन में, BFL ने Audi में प्रोडक्शन कार्यों पर इस तकनीक का परीक्षण करने के लिए Mimic Robotics के साथ साझेदारी की है। यह संकेत देता है कि Flux 3 के अंतर्निहित आर्किटेक्चर का उद्देश्य रोबोटिक्स के लिए एक आधार के रूप में कार्य करना है, जहाँ दुनिया के भौतिक नियमों को समझना उतना ही महत्वपूर्ण है जितना कि एक हाई-फिडेलिटी वीडियो बनाना।

डिप्लॉयमेंट और "Flux 3 Dev" ओपन-वेट का वादा

BFL सुरक्षा सुनिश्चित करने और यूजर फीडबैक इकट्ठा करने के लिए चरणबद्ध रोलआउट रणनीति अपना रहा है। Flux 3 Video वर्तमान में उपलब्ध है, और Flux 3 Image के अगले कुछ हफ्तों के भीतर अर्ली एक्सेस में लॉन्च होने की उम्मीद है। भविष्य की ओर देखते हुए, BFL ने "Flux 3 Dev" के नाम से मल्टीमॉडल बैकबोन तक ओपन-वेट एक्सेस जारी करने की प्रतिबद्धता जताई है, एक ऐसा कदम जो संभवतः दुनिया भर के डेवलपर्स और शोधकर्ताओं को उनके आर्किटेक्चर पर काम करने के लिए सशक्त बनाएगा।

मुख्य बातें

  • नेटिव मल्टीमोडैलिटी: Flux 3 इमेज, वीडियो और ऑडियो ट्रेनिंग को एक सिंगल "Self-Flow" ट्रांसफॉर्मर में एकीकृत करता है, जिससे सिंक्रोनाइज़्ड नेटिव ऑडियो के साथ 20-सेकंड के वीडियो संभव हो पाते हैं।
  • टॉप-टियर परफॉर्मेंस: शुरुआती टेस्टिंग में, Flux 3 ने Luma Ray 3.2 (93% प्रेफरेंस) और Runway Gen-4.5 (77% प्रेफरेंस) सहित प्रमुख प्रतिद्वंद्वियों को पीछे छोड़ दिया।
  • रोबोटिक्स इंटीग्रेशन: मॉडल में एक एक्शन-प्रेडिक्शन कंपोनेंट शामिल है जिसका वर्तमान में Mimic Robotics के माध्यम से Audi में प्रोडक्शन रोबोटिक्स कार्यों के लिए परीक्षण किया जा रहा है।