Xiaomi ने MiMo-V2.5 लाँच केले आहे, जे एक open-weight multimodal model आहे जे ऑडिओ, इमेज आणि व्हिडिओला native tokens म्हणून हाताळते. यामध्ये १,०५०,०००-टोकन कॉन्टेक्स्ट विंडो मिळते आणि प्रति १० लाख इनपुट टोकन्ससाठी $०.१४ आणि प्रति १० लाख आउटपुट टोकन्ससाठी $०.२८ या pay-as-you-go दराने किंमत आकारली जाते, जे प्रामुख्याने ज्या संस्थांना on-premise आणि मीडिया-हेवी AI ची गरज आहे, त्यांना लक्ष्य करते.

नवीन मल्टिमॉडल दृष्टिकोन का महत्त्वाचा आहे

बहुतेक सध्याचे मल्टिमॉडल सिस्टम्स शॉर्टकट घेतात. ते प्रथम speech-to-text इंजिन चालवतात, त्यानंतर एक vision model जे चित्रांचे कॅप्शनमध्ये रूपांतर करते आणि शेवटी तयार झालेला मजकूर large language model (LLM) मध्ये फीड करतात. LLM कधीही मूळ साऊंड वेव्ह किंवा पिक्सेल डेटा पाहत नाही, त्यामुळे सुस्कारा, विराम, चेहऱ्यावरील हालचाल किंवा हाताचे संकेत यांसारखे सूक्ष्म बारकावे (nuances) हरवतात. MiMo-V2.5 हा वळणदार मार्ग टाळते: ते ऑडिओ आणि व्हिडिओ थेट “tokens” म्हणून स्वीकारते, ज्यामुळे टायमिंग, टोन आणि व्हिज्युअल संकेत जतन केले जातात जे ट्रान्सक्रिप्टमध्ये टिपता येत नाहीत.

तांत्रिक व्याप्ती

  • Token window: १,०५०,००० टोकन्स – तासनतास चाललेल्या मीटिंगचे रेकॉर्डिंग तुकड्यांमध्ये न विभागता स्वीकारण्यासाठी पुरेसे आहेत.
  • Self-hosting: कंपनीच्या स्वतःच्या सर्व्हरवर मॉडेल तैनात (deploy) करा, जेणेकरून मूळ मीडिया डेटा कंपनीच्या आवाराबाहेर जाणार नाही.
  • Pricing: प्रति १० लाख इनपुट टोकन्ससाठी $०.१४, प्रति १० लाख आउटपुट टोकन्ससाठी $०.२८ – वापराप्रमाणे बदलणारी एक पारदर्शक किंमत.

केवळ मजकुराच्या (text-only) कोअरची झटपट पडताळणी करताना, या मॉडेलने अपेक्षित O(n log n) अल्गोरिदमसह एक क्लासिक merge-interval कोडिंग समस्या सोडवली, टँक-फिल रेटची गणिती समस्या टप्प्याटप्प्याने सोडवली आणि इनव्हॉइसमधून त्रुटीशिवाय JSON payload काढला. त्या चाचणीत ऑडिओ आणि व्हिडिओ पाइपलाइनचा वापर करण्यात आला नव्हता.

कोणाला फायदा होऊ शकतो

आरोग्यसेवा आणि वित्त यांसारख्या गोपनीयता-संवेदनशील (privacy-heavy) उद्योगांना मूळ ऑडिओ किंवा व्हिडिओ थर्ड-पार्टी APIs कडे पाठवता येत नाहीत. डेटा फायरवॉलच्या मागे ठेवून, MiMo-V2.5 या संस्थांना डेटा-संरक्षण नियमांचे पालन करण्यास मदत करते आणि त्याच वेळी AI-आधारित माहिती (insights) देखील मिळवून देते. संभाव्य उपयोगांमध्ये खालील गोष्टींचा समावेश आहे:

  • Meeting intelligence: वेगळ्या ट्रान्सक्रिप्शन टप्प्याशिवाय निर्णय, कृती आराखडा (action items) आणि वक्त्यांच्या भावना शोधण्यासाठी संपूर्ण व्हिडिओ रेकॉर्डिंगचे विश्लेषण करणे.
  • Call-center analytics: कॉलरच्या आवाजातील चिडचिड, संकोच किंवा आत्मविश्वास रिअल-टाइममध्ये ओळखणे.
  • On-device assistants: ऑडिओ क्लाउडवर न पाठवता टोन समजून घेणारे आणि अवाचिक संकेतांना (non-verbal cues) प्रतिसाद देणारे व्हॉइस इंटरफेस तयार करणे.

व्यावहारिक अडथळे

MiMo-V2.5 चे आश्वासन त्याच्या ऑडिओ आणि व्हिडिओ एनकोडर्सच्या कामगिरीवर अवलंबून आहे – ज्या घटकांची लेखकाने अद्याप बेंचमार्किंग केलेली नाही. कंपन्यांनी प्रत्यक्ष वापरासाठी (production) वचनबद्ध होण्यापूर्वी त्यांच्या स्वतःच्या डेटासेटवर लॅटन्सी (latency), अचूकता आणि हार्डवेअरचा वापर तपासणे आवश्यक आहे. ज्या टीम्सना फक्त मजकुराची गरज आहे, त्यांना कॉम्प्युट आणि खर्च या दोन्ही बाबतीत लहान, केवळ मजकूर आधारित मॉडेल अधिक कार्यक्षम वाटू शकते. MiMo-V2.5 च्या open-weight स्वरूपामुळे कोड आणि weights सार्वजनिकरित्या उपलब्ध आहेत; यामुळे सखोल सानुकूलन (customisation) शक्य होते, परंतु स्टॅक सुरक्षित ठेवण्यासाठी आणि देखभालीसाठी अंतर्गत तज्ज्ञांचीही गरज भासते.

निष्कर्ष

MiMo-V2.5 नेटिव्ह मीडिया टोकनायझेशन, मोठी कॉन्टेक्स्ट विंडो आणि स्पष्ट प्रति-टोकन खर्चासह सेल्फ-होस्टिंगची सुविधा देते. ज्या गोपनीयता-संवेदनशील संस्थांना मूळ ऑडिओ आणि व्हिडिओ स्वतःकडेच ठेवायचे आहेत, त्यांच्यासाठी हा एक व्यवहार्य पायलट मार्ग आहे. प्रत्यक्ष जगातील मूल्य हे त्याचे ऑडिओ आणि व्हिडिओ एनकोडर्स एंटरप्राइझ वर्कलोडमध्ये कसे काम करतात आणि सेल्फ-होस्टिंगचा ऑपरेशनल ओव्हरहेड सध्याच्या AI टीम्सच्या कौशल्य संचात बसतो का, यावर अवलंबून असेल.