Xiaomi ने MiMo-V2.5 लॉन्च किया है, जो एक open-weight multimodal मॉडल है जो ऑडियो, इमेज और वीडियो को native tokens के रूप में मानता है। यह 1,050,000-token का context window और $0.14 प्रति मिलियन input tokens तथा $0.28 प्रति मिलियन output tokens की pay-as-you-go कीमत प्रदान करता है, जिसका लक्ष्य उन संगठनों को है जिन्हें on-premise, media-heavy AI की आवश्यकता है।
एक नया multimodal दृष्टिकोण क्यों महत्वपूर्ण है
अधिकांश मौजूदा multimodal सिस्टम एक तरह का शॉर्टकट अपनाते हैं। वे पहले एक speech-to-text इंजन चलाते हैं, फिर एक vision मॉडल जो तस्वीरों को captions में बदल देता है, और अंत में प्राप्त टेक्स्ट को एक large language model (LLM) में डाल देते हैं। LLM कभी भी मूल sound wave या pixel data को नहीं देख पाता, इसलिए आह भरना, रुकना, चेहरे की मांसपेशियों का फड़कना या हाथ के इशारे जैसे सूक्ष्म अंतर (nuances) गायब हो जाते हैं। MiMo-V2.5 इस घुमावदार रास्ते को छोड़ देता है: यह ऑडियो और वीडियो को सीधे "tokens" के रूप में ग्रहण करता है, जिससे timing, tone और visual cues सुरक्षित रहते हैं जिन्हें एक transcript कैप्चर नहीं कर सकता।
तकनीकी विवरण
- Token window: 1,050,000 tokens – कई घंटों की मीटिंग रिकॉर्डिंग को टुकड़ों में विभाजित किए बिना ग्रहण करने के लिए पर्याप्त।
- Self-hosting: मॉडल को कंपनी के अपने सर्वर पर तैनात करें, ताकि raw media कभी परिसर (premises) से बाहर न जाए।
- Pricing: $0.14 प्रति मिलियन input tokens, $0.28 प्रति मिलियन output tokens – एक पारदर्शी लागत जो उपयोग के साथ बढ़ती है।
केवल टेक्स्ट-आधारित कोर के एक त्वरित sanity check में, मॉडल ने अपेक्षित O(n log n) एल्गोरिदम के साथ एक क्लासिक merge-interval कोडिंग समस्या को हल किया, एक टैंक-फिल रेट गणितीय समस्या को चरण-दर-चरण हल किया, और बिना किसी त्रुटि के एक इनवॉइस से JSON payload निकाला। उस परीक्षण में ऑडियो और वीडियो पाइपलाइनों का उपयोग नहीं किया गया था।
किसे लाभ होगा
हेल्थकेयर और फाइनेंस जैसे गोपनीयता-प्रधान (privacy-heavy) उद्योग कच्चे ऑडियो या वीडियो को थर्ड-पार्टी APIs पर नहीं भेज सकते। डेटा को फ़ायरवॉल के पीछे रखकर, MiMo-V2.5 इन संगठनों को AI-संचालित अंतर्दृष्टि (insights) प्राप्त करते हुए डेटा-सुरक्षा नियमों का पालन करने की अनुमति देता है। संभावित अनुप्रयोगों में शामिल हैं:
- Meeting intelligence: बिना किसी अलग transcription चरण के, निर्णयों, एक्शन आइटम्स और वक्ता के भाव (sentiment) को सामने लाने के लिए पूरी वीडियो रिकॉर्डिंग का विश्लेषण करें।
- Call-center analytics: कॉलर की आवाज़ में हताशा, हिचकिचाहट या आत्मविश्वास का वास्तविक समय (real time) में पता लगाएं।
- On-device assistants: ऐसे वॉइस इंटरफेस बनाएं जो ऑडियो को क्लाउड पर भेजे बिना टोन को समझें और गैर-मौखिक संकेतों (non-verbal cues) पर प्रतिक्रिया दें।
व्यावहारिक बाधाएं
MiMo-V2.5 का वादा इसके ऑडियो और वीडियो एनकोडर के प्रदर्शन पर निर्भर करता है – ऐसे घटक जिनका लेखक ने अभी तक बेंचमार्क नहीं किया है। उद्यमों (Enterprises) को प्रोडक्शन के लिए प्रतिबद्ध होने से पहले अपने स्वयं के डेटासेट पर लेटेंसी, सटीकता और हार्डवेयर खपत को सत्यापित करना चाहिए। जिन टीमों को केवल टेक्स्ट की आवश्यकता है, उन्हें संभवतः कंप्यूट और लागत दोनों में एक छोटा, केवल टेक्स्ट वाला मॉडल अधिक कुशल लगेगा। MiMo-V2.5 की open-weight प्रकृति का अर्थ है कि कोड और weights सार्वजनिक रूप से उपलब्ध हैं; यह गहन अनुकूलन (customisation) को सक्षम बनाता है लेकिन स्टैक को बनाए रखने और सुरक्षित करने के लिए इन-हाउस विशेषज्ञता की भी मांग करता है।
निष्कर्ष
MiMo-V2.5 नेटिव मीडिया टोकनाइज़ेशन, एक विशाल context window और स्पष्ट प्रति-टोकन लागत पर सेल्फ-होस्टिंग की सुविधा देता है। गोपनीयता के प्रति संवेदनशील संगठनों के लिए जिन्हें कच्चे ऑडियो और वीडियो को इन-हाउस रखना आवश्यक है, यह एक व्यवहार्य पायलट पथ प्रदान करता है। वास्तविक दुनिया का मूल्य इस बात पर निर्भर करेगा कि इसके ऑडियो और वीडियो एनकोडर एंटरप्राइज वर्कलोड के तहत कैसा प्रदर्शन करते हैं और क्या सेल्फ-होस्टिंग का परिचालन ओवरहेड मौजूदा AI टीमों के कौशल सेट के भीतर फिट बैठता है।
