Black Forest Labs એ Flux 3 રજૂ કર્યું: વિડિયો અને ઓડિયોમાં એક મલ્ટિમોડલ ક્રાંતિ
Black Forest Labs (BFL) એ Flux 3 ના வெளியાદેથી સત્તાવાર રીતે "world models" ના ક્ષેત્રમાં પ્રવેશ કર્યો છે, જે એક મલ્ટિમોડલ ફાઉન્ડેશન મોડલ છે અને તેને ડિજિટલ જનરેશન અને ભૌતિક બુદ્ધિ (physical intelligence) વચ્ચેના અંતરને ઘટાડવા માટે ડિઝાઇન કરવામાં આવ્યું છે. છબીઓ, વિડિયો અને ઓડિયો પર એકસાથે તાલીમ આપીને, Flux 3 સંવેદનાત્મક સુસંગતતા (sensory cohesion)નું એવું સ્તર પ્રાપ્ત કરે છે જે પરંપરાગત સિંગલ-મોડાલિટી મોડલ્સ માટે નકલ કરવી મુશ્કેલ છે.
મલ્ટિમોડલ તાલીમ અને નેટિવ ઓડિયોની શક્તિ
વિડિયો મોડલ્સની અગાઉની પેઢીઓથી વિપરીત, જેને અવાજ સિંક કરવા માટે ઘણીવાર અલગ પ્રક્રિયાઓની જરૂર પડે છે, Flux 3 ૨૦ સેકન્ડ સુધીના વિડિયો ક્લિપ્સ માટે નેટિવ ઓડિયો જનરેશન રજૂ કરે છે. આ વિકાસ BFL ના એ દર્શનમાં રહેલો છે કે કોઈ પણ એક મોડાલિટી વાસ્તવિકતાને સંપૂર્ણ રીતે પકડી શકતી નથી. જ્યારે છબીઓ અવકાશી માળખું (spatial structure) પૂરી પાડે છે અને વિડિયો સમયલક્ષી ફેરફારો (temporal changes) પૂરા પાડે છે, ત્યારે ઓડિયો યાંત્રિક ઘટનાઓ અને તેમના અવાજો વચ્ચેના કારણભૂત સંબંધો (causal links) દર્શાવે છે.
BFL ના પ્રોપ્રાઈટરી "Self-Flow" અભિગમ પર આધારિત મલ્ટિમોડલ ટ્રાન્સફોર્મરનો ઉપયોગ કરીને, આ મોડલ છબીઓ, વિડિયો, ઓડિયો અનેសકન ક્રિયાઓને (actions) પણ એક સહિયારા આંતરિક પ્રતિનિધિત્વમાં રૂપાંતરિત કરે છે. આ એકીકૃત તાલીમ મોડલને માહિતીના અંતરોને ભરવાની મંજૂરી આપે છે—દાખલા તરીકે, વિઝ્યુઅલ મૂવમેન્ટના ભૌતિકશાસ્ત્રને વધુ સારી રીતે સમજવા માટે ઓડિયો સંકેતોનો ઉપયોગ કરવો. Flux 3 ટેક્સ્ટ-ટુ-વિડિયો, ઈમેજ-ટુ-વિડિયો, કીફ્રેમ-આધારિત ટ્રાન્ઝિશન અને બહુભાષી સંવાદો સહિત અદ્યતન સુવિધાઓની વિશાળ શ્રેણીને સપોર્ટ કરે છે.
ઉદ્યોગના દિગ્ગજો સામે Flux 3 નું બેન્ચમાર્કિંગ
720p રિઝોલ્યુશન પર 10-સેકન્ડની ક્લિપ્સનો ઉપયોગ કરીને પ્રારંભિક મૂલ્યાંકનમાં, Flux 3 એ નોંધપાત્ર સ્પર્ધાત્મક લાભો દર્શાવ્યા હતા. યુઝર પ્રેફરન્સ ટેસ્ટમાં, BFL એ નોંધ્યું હતું કે 93% તુલનાઓમાં Flux 3 ને Luma Ray 3.2 કરતા અને 77% કિસ્સાઓમાં Runway Gen-4.5 કરતા વધુ પસંદ કરવામાં આવ્યું હતું.
જોકે શ્રેષ્ઠ સ્પર્ધકો સામે તફાવત ઓછો છે, તેમ છતાં Flux 3 એ Grok Imagine Video (69%) અને Kling v3 Pro (60%) પર લીડ જાળવી રાખી છે. તેણે 52% પ્રેફરન્સ રેટ સાથે Seedance 2.0 અને Gemini Omni Flash ને પણ પાછળ છોડી દીધા છે. આ પરિણામો સૂચવે છે કે Flux 3 પોતાને જનરેટિવ વિડિયો મોડલ્સના ટોચના સ્તરે સ્થાપિત કરી રહ્યું છે, જે પ્રોફેશનલ હોલીવુડ વર્કફ્લોમાં પહેલેથી જ વપરાતી સિસ્ટમો સાથે સ્પર્ધા કરવા સક્ષમ છે.
કન્ટેન્ટ ક્રિએશનથી આગળ: રોબોટિક્સ તરફ પ્રયાણ
કદાચ Flux 3 નો સૌથી મહત્વાકાંક્ષી પાસા તેની "real-world visual intelligence" તરફની ગતિ છે. BFL માત્ર એક સર્જનાત્મક સાધન નથી બનાવી રહ્યું; તેઓ એક એવું મોડલ બનાવી રહ્યા છે જે જોઈ શકે, આગાહી કરી શકે અને કાર્ય કરી શકે. તેના ટ્રાન્સફોર્મર આર્કિટેક્ચરની અંદર એક સમર્પિત એક્શન કમ્પોનન્ટ દ્વારા, આ મોડલનો ઉપયોગ "Flux-mimic" વિકસાવવા માટે કરવામાં આવી રહ્યો છે, જે એક વિડિયો-એક્શન મોડલ છે.
ઉચ્ચ-જોખમ ધરાવતા વાસ્તવિક ઉપયોગમાં, BFL એ Audi માં ઉત્પાદન કાર્યો પર આ ટેકનોલોજીનું પરીક્ષણ કરવા માટે Mimic Robotics સાથે ભાગીદારી કરી છે. આ સૂચવે છે કે Flux 3 નું મૂળભૂત આર્કિટેક્ચર રોબોટિક્સ માટે પાયા તરીકે કામ કરવા માટે બનાવવામાં આવ્યું છે, જ્યાં વિશ્વના ભૌતિક નિયમોને સમજવા એ હાઈ-ફિડેલિટી વિડિયો જનરેટ કરવા જેટલું જ મહત્વનું છે.
ડિપ્લોયમેન્ટ અને "Flux 3 Dev" ઓપન-વેઇટ વચન
સુરક્ષા સુનિશ્ચિત કરવા અને વપરાશકર્તાઓના પ્રતિસાદ મેળવવા માટે BFL તબક્કાવાર રોલઆઉટ વ્યૂહરચના અપનાવી રહ્યું છે. Flux 3 Video હાલમાં ઉપલબ્ધ છે, જ્યારે Flux 3 Image આગામી થોડા અઠવાડિયામાં અર્લી એક્સેસમાં લોન્ચ થવાની અપેક્ષા છે. ભવિષ્યમાં જોતા, BFL એ "Flux 3 Dev" ના નામે મલ્ટિમોડલ બેકબોન માટે ઓપન-વેઇટ એક્સેસ આપવાનું વચન આપ્યું છે, જે સંભવતઃ વૈશ્વિક સ્તરે ડેવલપર્સ અને સંશોધકોને તેમના આર્કિટેક્ચર પર કામ કરવા માટે સક્ષમ બનાવશે.
મુખ્ય મુદ્દાઓ
- નેટિવ મલ્ટિમોડાલિટી: Flux 3 છબી, વિડિયો અને ઓડિયો તાલીમને એક સિંગલ "Self-Flow" ટ્રાન્સફોર્મરમાં સંકલિત કરે છે, જે સિંક્રનાઇઝ્ડ નેટિવ ઓડિયો સાથે ૨૦-સેકન્ડના વિડિયો બનાવવાની ક્ષમતા આપે છે.
- ટોપ-ટિયર પરફોર્મન્સ: પ્રારંભિક પરીક્ષણમાં, Flux 3 એ Luma Ray 3.2 (93% પસંદગી) અને Runway Gen-4.5 (77% પસંદગી) સહિતના મુખ્ય હરીફોને પાછળ છોડી દીધા છે.
- રોબોટિક્સ ઇન્ટિગ્રેશન: આ મોડલમાં એક્શન-પ્રેડિક્શન કમ્પોનન્ટ શામેલ છે જે હાલમાં Mimic Robotics દ્વારા Audi માં ઉત્પાદન રોબોટિક્સ કાર્યો માટે પરીક્ષણ હેઠળ છે.
