Black Forest Labs Flux 3-ஐ அறிமுகப்படுத்துகிறது: வீடியோ மற்றும் ஆடியோவில் ஒரு மல்டிமோடல் (Multimodal) முன்னேற்றம்
டிஜிட்டல் உருவாக்கம் மற்றும் இயற்பியல் நுண்ணறிவு (physical intelligence) ஆகியவற்றிற்கு இடையிலான இடைவெளியைக் குறைக்கும் வகையில் வடிவமைக்கப்பட்ட ஒரு மல்டிமோடல் அடிப்படை மாதிரியான (multimodal foundation model) Flux 3-ஐ வெளியிடுவதன் மூலம், Black Forest Labs (BFL) அதிகாரப்பூர்வமாக "உலக மாதிரிகளின்" (world models) எல்லையில் நுழைந்துள்ளது. படங்கள், வீடியோ மற்றும் ஆடியோ ஆகியவற்றில் ஒரே நேரத்தில் பயிற்சி பெறுவதன் மூலம், Flux 3 ஒரு உணர்வு ரீதியான ஒருங்கிணைப்பை (sensory cohesion) எட்டுகிறது; இதை பாரம்பரிய ஒற்றை-முறை (single-modality) மாதிரிகளால் நகலெடுக்க முடிவதில்லை.
மல்டிமோடல் பயிற்சி மற்றும் நேட்டிவ் ஆடியோவின் (Native Audio) ஆற்றல்
ஒலியை ஒருங்கிணைக்க பெரும்பாலும் தனித்தனி செயல்முறைகளைத் தேவைப்படும் முந்தைய தலைமுறை வீடியோ மாதிரிகளைப் போலல்லாமல், Flux 3 20 வினாடிகள் வரையிலான வீடியோ கிளிப்களுக்கு நேட்டிவ் ஆடியோ உருவாக்கத்தை (native audio generation) அறிமுகப்படுத்துகிறது. எந்தவொரு ஒற்றை முறையாலும் யதார்த்தத்தை முழுமையாகப் பிடிக்க முடியாது என்ற BFL-இன் தத்துவத்தில் இந்த வளர்ச்சி வேரூன்றியுள்ளது. படங்கள் இடஞ்சார்ந்த கட்டமைப்பை (spatial structure) வழங்குகின்றன மற்றும் வீடியோ கால மாற்றங்களை (temporal changes) வழங்குகிறது என்றால், ஆடியோ இயந்திர நிகழ்வுகளுக்கும் அவற்றின் ஒலிகளுக்கும் இடையிலான காரணத் தொடர்புகளை வெளிப்படுத்துகிறது.
BFL-இன் பிரத்யேகமான "Self-Flow" அணுகுமுறையை அடிப்படையாகக் கொண்ட ஒரு மல்டிமோடல் டிரான்ஸ்பார்மரை (multimodal transformer) பயன்படுத்துவதன் மூலம், இந்த மாதிரி படங்கள், வீடியோ, ஆடியோ மற்றும் செயல்களைக் கூட ஒரு பொதுவான உள் பிரதிநிதித்துவமாக (shared internal representation) மாற்றுகிறது. இந்த ஒருங்கிணைந்த பயிற்சி, தகவலுக்கான இடைவெளிகளை நிரப்ப மாதிரியை அனுமதிக்கிறது—உதாரணமாக, ஒரு காட்சி இயக்கத்தின் இயற்பியலை (physics) சிறப்பாகப் புரிந்துகொள்ள ஆடியோ குறிப்புகளைப் பயன்படுத்துவது போன்றது. Flux 3 ஆனது text-to-video, image-to-video, keyframe-அடிப்படையிலான மாற்றங்கள் மற்றும் பலமொழி உரையாடல்கள் உட்பட பல மேம்பட்ட அம்சங்களை ஆதரிக்கிறது.
தொழில்துறையின் ஜாம்பவான்களுடன் Flux 3-இன் ஒப்பீடு
720p தெளிவுத்திறனில் (resolution) 10 வினாடி கிளிப்களைப் பயன்படுத்தி நடத்தப்பட்ட ஆரம்பகட்ட மதிப்பீடுகளில், Flux 3 குறிப்பிடத்தக்க போட்டி நன்மைகளை வெளிப்படுத்தியது. பயனர்களின் நேரடி விருப்பத் தேர்வுகளில் (user preference tests), 93% ஒப்பீடுகளில் Luma Ray 3.2-ஐ விடவும், 77% சந்தர்ப்பங்களில் Runway Gen-4.5-ஐ விடவும் Flux 3 விரும்பப்படுவதாக BFL தெரிவித்துள்ளது.
உயர்தரப் போட்டியாளர்களுடன் ஒப்பிடும்போது இடைவெளி குறைவாக இருந்தாலும், Flux 3 இன்னும் Grok Imagine Video (69%) மற்றும் Kling v3 Pro (60%) ஆகியவற்றிற்கு முன்னால் உள்ளது. இது Seedance 2.0 மற்றும் Gemini Omni Flash ஆகியவற்றையும் 52% விருப்ப விகிதத்துடன் outperformed செய்தது. இந்த முடிவுகள், Flux 3 தன்னை உருவாக்கும் வீடியோ மாதிரிகளின் (generative video models) மிக உயர்ந்த நிலையில் நிலைநிறுத்திக் கொள்கிறது என்பதையும், ஏற்கனவே ஹாலிவுட் தொழில்முறை பணிப்பாய்வுகளில் (professional Hollywood workflows) ஒருங்கிணைக்கப்பட்டுள்ள அமைப்புகளுடன் போட்டியிடக்கூடியது என்பதையும் உணர்த்துகின்றன.
உள்ளடக்க உருவாக்கத்திற்கு அப்பால்: ரோபாட்டிக்ஸ் நோக்கி நகர்தல்
Flux 3-இன் மிகவும் லட்சியமான அம்சம் அதன் "யதார்த்த உலக காட்சி நுண்ணறிவு" (real-world visual intelligence) நோக்கிய நகர்வுதான். BFL வெறும் படைப்புத் கருவியை மட்டும் உருவாக்கவில்லை; அவை உணரக்கூடிய, கணிக்கக்கூடிய மற்றும் செயல்படக்கூடிய ஒரு மாதிரியை உருவாக்குகின்றன. அதன் டிரான்ஸ்பார்மர் கட்டமைப்பிற்குள் (transformer architecture) உள்ள ஒரு பிரத்யேக செயல் கூறின் (action component) மூலம், "Flux-mimic" என்ற வீடியோ-செயல் மாதிரி (video-action model) உருவாக்கப் பயன்படுத்தப்படுகிறது.
ஒரு முக்கியமான நிஜ உலகப் பயன்பாட்டில், Audi நிறுவனத்தின் உற்பத்திப் பணிகளில் இந்தத் தொழில்நுட்பத்தைச் சோதிக்க BFL, Mimic Robotics உடன் இணைந்துள்ளது. Flux 3-இன் அடிப்படை கட்டமைப்பு ரோபாட்டிக்ஸிற்கான ஒரு அடித்தளமாகச் செயல்படுவதை இது காட்டுகிறது; அங்கு உலகின் இயற்பியல் விதிகளைப் புரிந்துகொள்வது, ஒரு உயர்தர வீடியோவை உருவாக்குவது போலவே முக்கியமானது.
பயன்பாட்டு முறை மற்றும் "Flux 3 Dev" திறந்த-எடை (Open-Weight) வாக்குறுதி
பாதுகாப்பை உறுதி செய்யவும் மற்றும் பயனர்களின் கருத்துக்களைப் பெறவும் BFL படிப்படியான வெளியீட்டு உத்தியை (phased rollout strategy) பின்பற்றி வருகிறது. Flux 3 Video தற்போது கிடைக்கிறது, Flux 3 Image அடுத்த சில வாரங்களுக்குள் ஆரம்பக்கட்ட அணுகலில் (early access) வெளியாகும் என்று எதிர்பார்க்கப்படுகிறது. மேலும் எதிர்காலத்தைக் கருத்தில் கொண்டு, "Flux 3 Dev" என்ற பெயரில் மல்டிமோடல் முதுகெலும்புக்கு (multimodal backbone) திறந்த-எடை அணுகலை (open-weight access) வழங்க BFL உறுதியளித்துள்ளது. இந்த நடவடிக்கை உலகெங்கிலும் உள்ள டெவலப்பர்கள் மற்றும் ஆராய்ச்சியாளர்கள் அவர்களின் கட்டமைப்பின் அடிப்படையில் புதியவற்றை உருவாக்க உதவும்.
முக்கியக் குறிப்புகள்
- நேட்டிவ் மல்டிமோடாலிட்டி (Native Multimodality): Flux 3 ஆனது படம், வீடியோ மற்றும் ஆடியோ பயிற்சியை ஒரே "Self-Flow" டிரான்ஸ்பார்மரில் ஒருங்கிணைக்கிறது, இது ஒருங்கிணைக்கப்பட்ட நேட்டிவ் ஆடியோவுடன் 20 வினாடி வீடியோக்களை உருவாக்க அனுமதிக்கிறது.
- உயர்தர செயல்திறன்: ஆரம்பகட்ட சோதனையில், Flux 3 ஆனது Luma Ray 3.2 (93% விருப்பம்) மற்றும் Runway Gen-4.5 (77% விருப்பம்) உள்ளிட்ட முக்கியப் போட்டியாளர்களை விடச் சிறப்பாகச் செயல்பட்டது.
- ரோபாட்டிக்ஸ் ஒருங்கிணைப்பு: இந்த மாதிரியில் ஒரு செயல்-கணிப்பு (action-prediction) கூறு உள்ளது, இது தற்போது Mimic Robotics மூலம் Audi நிறுவனத்தின் உற்பத்தி ரோபாட்டிக்ஸ் பணிகளுக்காகச் சோதிக்கப்பட்டு வருகிறது.
