Xiaomi ने MiMo V2.5 लॉन्च किया है, जो एक open-weight multimodal मॉडल है। यह ऑडियो, इमेज और वीडियो को native tokens के रूप में ट्रीट करता है और 1.05-मिलियन-टोकन का context window प्रदान करता है। इसकी प्राइसिंग शीट में $0.14 प्रति मिलियन input tokens और $0.28 प्रति मिलियन output tokens दिए गए हैं, यह लागत संरचना इसे एक ही प्रॉम्प्ट में लंबी मीटिंग या वीडियो स्ट्रीम चलाने के लिए व्यावहारिक बनाती है।
"open-weight" क्यों महत्वपूर्ण है
अधिकांश multimodal AI अलग-अलग front-ends को जोड़कर काम करते हैं: एक speech-to-text इंजन, एक image-captioning मॉडल, और फिर प्राप्त टेक्स्ट को एक large language model (LLM) में फीड किया जाता है। LLM कभी भी raw waveform या pixel data को नहीं देख पाता, इसलिए लहजा (tone), ठहराव (pauses) या हाव-भाव (gestures) जैसे सूक्ष्म अंतर खो सकते हैं। Xiaomi का दावा है कि MiMo V2.5 सीधे ऑडियो और वीडियो को ग्रहण करता है, जिससे timing, intonation और visual cues सुरक्षित रहते हैं। सैद्धांतिक रूप से, यह मॉडल को फोन कॉल में आह (sigh) को पहचानने, व्हाइटबोर्ड पर बने स्केच का अनुसरण करने, या बिना किसी मध्यवर्ती ट्रांसक्रिप्शन स्टेप के एक साथ बोलने वाले वक्ताओं (overlapping speakers) के बीच अंतर करने की अनुमति देता है।
क्योंकि मॉडल के weights सार्वजनिक रूप से जारी किए गए हैं, इसलिए संगठन इसे डाउनलोड कर सकते हैं और on-premise चला सकते हैं। यह raw media को cloud APIs पर भेजने की सामान्य प्रथा से बचता है, जो एक ऐसा कदम है जिसे कई विनियमित क्षेत्र—जैसे स्वास्थ्य सेवा (healthcare) और वित्त (finance)—लेने में संकोच करते हैं या उन्हें ऐसा करने से रोका जाता है।
तकनीकी मुख्य आंकड़े
- Context window: 1.05 मिलियन टोकन, जो एक ही रिक्वेस्ट में कई घंटों की मीटिंग या पूरी डॉक्यूमेंट्री को समाहित करने के लिए पर्याप्त है।
- Pricing: $0.14 प्रति मिलियन input tokens, $0.28 प्रति मिलियन output tokens।
- Modalities: ऑडियो, इमेज, वीडियो, साथ ही मानक टेक्स्ट हैंडलिंग।
इसका बड़ा context window सबसे खास बात है। पारंपरिक LLMs कुछ हज़ार टोकन तक ही सीमित रहते हैं, जिससे डेवलपर्स को लंबी रिकॉर्डिंग को टुकड़ों में बांटने या वीडियो को छोटे क्लिप्स में विभाजित करने के लिए मजबूर होना पड़ता है। MiMo V2.5 के साथ, एक ही प्रॉम्प्ट में बिना किसी टुकड़े किए कई घंटों की मीटिंग शामिल की जा सकती है।
टेक्स्ट इंजन की पहली झलक
हालांकि ऑडियो और वीडियो पाइपलाइनों का स्वतंत्र रूप से बेंचमार्किंग नहीं किया गया है, लेकिन टेक्स्ट कोर ने एक त्वरित सैनिटी चेक (sanity check) पास कर लिया है:
- Coding: मॉडल ने एक क्लासिक “merge intervals” समस्या को हल किया और
O(n log n)जटिलता वाला एक एल्गोरिदम तैयार किया, जो दर्शाता है कि यह एल्गोरिथम संबंधी बाधाओं (constraints) को समझ सकता है। - Reasoning: इसने चार सटीक गणनाओं में एक बहु-चरणीय गणितीय शब्द समस्या (multi-step math word problem) का उत्तर दिया, जो इसकी chain-of-thought क्षमता को प्रदर्शित करता है।
- Structured output: एक इनवॉइस इमेज विवरण दिए जाने पर, इसने लाइन आइटम, कुल राशि और तारीखों के साथ एक सही ढंग से फॉर्मेट किया गया JSON ऑब्जेक्ट दिया।
एक मजबूत टेक्स्ट फाउंडेशन महत्वपूर्ण है क्योंकि वही transformer आर्किटेक्चर multimodal रास्तों का आधार है। यदि भाषा वाला हिस्सा कमजोर पड़ता है, तो ऑडियो या वीडियो संकेतों (cues) को जोड़ने की मॉडल की क्षमता सीमित हो जाएगी।
गोपनीयता-प्रथम (Privacy-first) उपयोग के मामले
वे उद्यम (Enterprises) जिन्हें raw media को अपने पास ही रखना अनिवार्य है, वे अब निम्नलिखित के लिए एक एकल, self-hosted स्टैक की कल्पना कर सकते हैं:
- Meeting intelligence: रिकॉर्डिंग को किसी तीसरे पक्ष (third-party) की सेवा पर भेजे बिना सारांश (summaries), एक्शन-आइटम एक्सट्रैक्शन, स्पीकर एट्रिब्यूशन और सेंटीमेंट एनालिसिस।
- Call analytics: वास्तविक समय (real time) में तनाव, हताशा या अनुपालन (compliance) से संबंधित कीवर्ड का पता लगाना।
- Voice interfaces: ऐसे चैटबॉट्स बनाना जो लहजे (tone) को समझ सकें और उचित स्वर उतार-चढ़ाव (vocal inflection) के साथ उत्तर दे सकें।
- Video analysis: वेबिनार के दौरान हाव-भाव (gestures), स्लाइड परिवर्तन या ऑन-स्क्रीन ड्राइंग को पहचानना।
तीन अलग-अलग वेंडर समाधानों को एक मॉडल से बदलने से इंटीग्रेशन का बोझ कम होता है और डेटा-लीकेज के बिंदुओं में कमी आती है।
सावधानियां और क्या सत्यापित करें
ऑडियो और वीडियो क्षमताएं अभी भी निर्माता के दावे हैं; कोई स्वतंत्र माप प्रकाशित नहीं किया गया है। संभावित उपयोगकर्ताओं को प्रोडक्शन वर्कलोड के लिए प्रतिबद्ध होने से पहले प्रतिनिधि डेटासेट पर अपना स्वयं का बेंचमार्क चलाना चाहिए।
मूल्य निर्धारण (Pricing), हालांकि पारदर्शी है, प्रति-टोकन आधारित है।
आगे क्या देखें
- Benchmark releases: ऑडियो/वीडियो टोकनाइज़ेशन की गुणवत्ता, लेटेंसी (latency) और मेमोरी फुटप्रिंट का तीसरे पक्ष द्वारा मूल्यांकन।
- Tooling ecosystem: लोकप्रिय ऑडियो कोडक (codecs) और वीडियो कंटेनरों के लिए ओपन-सोर्स एडेप्टर जो सीधे MiMo V2.5 में फीड होते हैं।
- Regulatory feedback: क्या डेटा-गोपनीयता नियामक क्लाउड APIs की तुलना में self-hosted open-weight मॉडलों को पर्याप्त सुरक्षा के रूप में देखते हैं।
- Community contributions: चूंकि weights सार्वजनिक हैं, इसलिए समुदाय विशिष्ट क्षेत्रों (जैसे चिकित्सा डिक्टेशन, कानूनी बयान) के लिए मॉडल को fine-tune कर सकता है।
MiMo V2.5 बातचीत को "मल्टीमॉडल ग्लू" से "मल्टीमॉडल ब्रेन" की ओर ले जाता है, जिसे कॉर्पोरेट फायरवॉल के पीछे चलाया जा सकता है। इसकी ओपन-वेट प्रकृति गोपनीयता के प्रति संवेदनशील संगठनों के लिए बाधाओं को कम करती है, लेकिन वादा की गई ऑडियो/वीडियो गुणवत्ता को अभी भी प्रमाण की आवश्यकता है। जब तक स्वतंत्र परीक्षण इन दावों की पुष्टि नहीं कर देते, तब तक इस मॉडल की सबसे बड़ी खासियत इसकी विशाल कॉन्टेक्स्ट विंडो और कई AI सेवाओं को एक एकल, सेल्फ-होस्टेड स्टैक में समेकित करने की संभावना बनी हुई है।
