रँकिंग का महत्त्वाची आहे

AI-द्वारे तयार केलेले व्हिडिओ प्रदीर्घ काळ अशा प्रोप्रायटरी (proprietary) सिस्टम्सच्या वर्चस्वाखाली राहिले आहेत ज्या त्यांचे weights लपवून ठेवतात, ज्यामुळे मालकी कंपनी वगळता इतर सर्वांना या प्रक्रियेपासून दूर ठेवले जाते. आपले weights प्रसिद्ध करून, MiniMax संशोधक आणि स्वतंत्र (indie) डेव्हलपर्सना तेच प्रवेश देते जो ओपन-सोर्स टेक्स्ट मॉडेल्सना गेल्या अनेक वर्षांपासून मिळत आला आहे. बेंचमार्कमधील ही जीत दर्शवते की एखादे खुले (openly available) मॉडेल केवळ खर्चाच्या बाबतीतच नाही, तर गुणवत्तेच्या बाबतीतही स्पर्धा करू शकते.

ओपन-वेट स्पर्धकाचा प्रवास

MiniMax चे H3 हे जनरेटिव्ह-व्हिडिओ प्रयत्नांची एक मालिका पुढे नेत आहे, ज्याने रिझोल्यूशन, फ्रेम रेट आणि सुसंगतता (coherence) मध्ये सातत्याने सुधारणा केली आहे. ज्या दिवशी ByteDance ने Seedance 2.5 लाँच केले, ते एक असे मॉडेल आहे जे ३० सेकंदांचे क्लिप्स रेंडर करते परंतु त्याचा कोड आणि weights कॉर्पोरेट फायरवॉलच्या मागे सुरक्षित ठेवते. MiniMax ने याच्या उलट मार्ग स्वीकारला आणि ३३-बिलियन-पॅरामीटरचे मॉडेल प्रकाशित केले जे मजकूर (text), प्रतिमा (images), व्हिडिओ आणि ऑडिओ एकाच वेळी हाताळू शकते.

हे मॉडेल काय करू शकते

  • मल्टीमोडल इनपुट – एकाच प्रॉम्प्टमध्ये नऊ संदर्भ प्रतिमा, तीन लहान व्हिडिओ क्लिप्स आणि तीन ऑडिओ क्लिप्स असू शकतात. रेंडरिंग करण्यापूर्वी मॉडेल या सिग्नलना एका संरचित मध्यवर्ती स्वरूपात (structured intermediate representation) एकत्रित करते.
  • आउटपुटची लांबी आणि गुणवत्ता – H3 ४ ते १५ सेकंदांचे व्हिडिओ सेगमेंट तयार करते, ज्यामध्ये प्रत्येक सेगमेंटमध्ये सिंक्रोनाइझ्ड स्टिरिओ साउंड असतो.
  • पॅरामीटर संख्या – ३३ बिलियन पॅरामीटर्ससह, हे नेटवर्क आघाडीच्या क्लोज्ड-सोर्स (closed-source) मॉडेल्सच्या आकाराशी सुसंगत आहे, ज्यामुळे त्याला सूक्ष्म हालचाल (fine-grained motion) आणि पोत (texture) टिपण्यास मदत होते.

या क्षमता एका सामान्य समस्येवर उपाय करतात: फ्रेम्समध्ये दृश्य (visual) आणि श्राव्य (auditory) सुसंगतता राखणे. संदर्भांचा अधिक समृद्ध संच उपलब्ध करून देऊन, H3 "जंप-कट" (jump-cut) आर्टिफॅक्ट्स कमी करते, जे अनेक टेक्स्ट-टू-व्हिडिओ सिस्टममध्ये समस्या निर्माण करतात.

लपलेले घटक

MiniMax ने जाणीवपूर्वक दोन घटक बंद ठेवले आहेत: २K रिझोल्यूशनसाठी अपसॅम्पल (upsample) करणारे मॉड्यूल आणि H3-Context-IR इंजिन जे मल्टीमोडल प्रॉम्प्टला अंतर्गत फॉरमॅटमध्ये रूपांतरित करते. अपस्केलरशिवाय, लोकल मशीनवर तुम्हाला जास्तीत जास्त ७६८p रिझोल्यूशन मिळू शकते. संदर्भ साहित्य तयार करण्यासाठी वापरकर्त्यांना MiniMax च्या प्रॉम्प्टिंग मार्गदर्शनांचे पालन करावे लागते, जे नवीन लोकांसाठी तांत्रिक असू शकते.

H3 स्थानिक पातळीवर (locally) चालवणे

तुम्ही कम्युनिटी-ड्रिव्हन ComfyUI इंटरफेसद्वारे मॉडेल लोड करू शकता. मुख्य weights मोफत आहेत, परंतु रिझोल्यूशनची मर्यादा असल्यामुळे जोपर्यंत छंदविद् (hobbyists) आणि लहान स्टुडिओ प्रोप्रायटरी अपस्केलर खरेदी करत नाहीत, तोपर्यंत त्यांना कमी पिक्सेल आउटपुट स्वीकारणे भाग पडते. कस्टम फुटेज, पात्रे किंवा व्हिज्युअल स्टाइल्सवर फाईन-ट्यूनिंगला सपोर्ट दिला जातो, ज्यामुळे डेव्हलपर्सना अशी सर्जनशील स्वातंत्र्य मिळते जी क्लोज्ड मॉडेल्समध्ये नसते.

लायसन्सिंगमुळे व्यावसायिक फायद्यावर मर्यादा येतात

MiniMax चे लायसन्स केवळ २० दशलक्ष डॉलर्सपेक्षा कमी वार्षिक महसूल असलेल्या कंपन्यांना व्यावसायिक वापराची परवानगी देते. ही अट कंपनीचे मोठ्या उद्योगांपासून संरक्षण करते, जे MiniMax च्या स्वतःच्या सेवांकडे दुर्लक्ष करून या तंत्रज्ञानाचे मोठ्या प्रमाणावर व्यापारीकरण करू शकतात. स्टार्टअप्स आणि संशोधन प्रयोगशाळांना उदार अटींचा लाभ मिळतो; मोठ्या कंपन्यांना स्वतंत्र करारासाठी वाटाघाटी (negotiate) कराव्या लागतात.

प्रतिवाद: काही लोक क्लोज्ड मॉडेल्स का निवडू शकतात

  • जास्त लांबीच्या क्लिप्स – ByteDance ची सिस्टम ३० सेकंदांचे व्हिडिओ तयार करू शकते, जे H3 च्या कमाल लांबीच्या दुप्पट आहे.

पुढे काय पाहावे

  • **

निष्कर्ष

MiniMax चे H3 हे सिद्ध करते की एखादा ओपन-वेट व्हिडिओ जनरेटर बेंचमार्क गुणवत्तेमध्ये क्लोज्ड जायंट्सना हरवू शकतो, परंतु त्याचे मर्यादित रिझोल्यूशन, अतिरिक्त बंद घटक आणि महसूल-मर्यादित लायसन्स यामुळे ते प्रामुख्याने संशोधक, स्टार्टअप्स आणि छंदविद् यांच्या मर्यादेत राहते. मॉडेलची मल्टीमोडल लवचिकता आणि फाईन-ट्यूनिंग स्वातंत्र्य ओपन-सोर्स समुदायाला आकर्षित करते, तर जोपर्यंत ओपन इकोसिस्टम उरलेल्या त्रुटी भरून काढत नाही, तोपर्यंत मोठे उद्योग प्रोप्रायटरी सोल्यूशन्सकडेच वळू शकतात.