Xiaomi ने MiMo V2.5 लाँच केले आहे, जे एक ओपन-वेट मल्टीमोडल मॉडेल आहे. हे मॉडेल ऑडिओ, इमेज आणि व्हिडिओला नेटिव्ह टोकन्स म्हणून हाताळते आणि १.०५ दशलक्ष टोकन्सची कॉन्टेक्स्ट विंडो (context window) प्रदान करते. त्याच्या किंमत पत्रकानुसार, प्रति दशलक्ष इनपुट टोकन्ससाठी $०.१४ आणि प्रति दशलक्ष आउटपुट टोकन्ससाठी $०.२८ शुल्क आकारले जाते; ही खर्च रचना एकाच प्रॉम्प्टमध्ये दीर्घकालीन मीटिंग किंवा व्हिडिओ स्ट्रीम चालवणे व्यवहार्य बनवते.

“open-weight” का महत्त्वाचे आहे

बहुतेक मल्टीमोडल AI मॉडेल्स वेगळे फ्रंट-एंड्स एकत्र जोडतात: एक स्पीच-टू-टेक्स्ट इंजिन, एक इमेज-कॅप्शनिंग मॉडेल आणि त्यानंतर तयार झालेला मजकूर लार्ज लँग्वेज मॉडेल (LLM) मध्ये फीड केला जातो. LLM कधीही रॉ वेव्हफॉर्म किंवा पिक्सेल डेटा पाहू शकत नाही, त्यामुळे टोन, पॉजेस किंवा हावभाव यांसारखे बारकावे गमावले जाऊ शकतात. Xiaomi चा दावा आहे की MiMo V2.5 ऑडिओ आणि व्हिडिओ थेट ग्रहण करते, ज्यामुळे टायमिंग, इन्टोनेशन आणि व्हिज्युअल क्यूज (दृश्य संकेत) जतन केले जातात. सिद्धांतानुसार, यामुळे मॉडेल फोन कॉलमधील सुस्कारा ओळखू शकते, व्हाईटबोर्डवरील स्केच फॉलो करू शकते किंवा मध्यवर्ती ट्रान्सक्रिप्शन स्टेपशिवाय एकमेकांवर बोलणारे वक्ते ओळखू शकते.

मॉडेलचे वेट्स (weights) खुलेपणे उपलब्ध असल्यामुळे, संस्था ते डाउनलोड करून ऑन-प्रिमाइस (स्वतःच्या सर्व्हरवर) चालवू शकतात. यामुळे रॉ मीडिया क्लाउड API कडे पाठवण्याची सामान्य पद्धत टाळता येते, जी आरोग्यसेवा आणि वित्त यांसारख्या अनेक नियंत्रित क्षेत्रांना स्वीकारणे कठीण किंवा निषिद्ध आहे.

तांत्रिक मुख्य आकडेवारी

  • कॉन्टेक्स्ट विंडो: १.०५ दशलक्ष टोकन्स, जे एका विनंतीमध्ये अनेक तासांची मीटिंग किंवा पूर्ण लांबीचा डॉक्युमेंटरी समाविष्ट करण्यासाठी पुरेसे आहेत.
  • किंमत: प्रति दशलक्ष इनपुट टोकन्ससाठी $०.१४, प्रति दशलक्ष आउटपुट टोकन्ससाठी $०.२८.
  • मोडालिटीज: ऑडिओ, इमेज, व्हिडिओ, सोबतच मानक टेक्स्ट हँडलिंग.

यातील मोठी कॉन्टेक्स्ट विंडो आकर्षणाचे केंद्र ठरते. पारंपारिक LLMs काही हजार टोकन्सपर्यंत मर्यादित असतात, ज्यामुळे डेव्हलपर्सना लांब रेकॉर्डिंगचे तुकडे करावे लागतात किंवा व्हिडिओचे लहान क्लिप्समध्ये विभाजन करावे लागते. MiMo V2.5 सह, एकच प्रॉम्प्ट तुकडे न करता अनेक तासांची मीटिंग समाविष्ट करू शकतो.

टेक्स्ट इंजिनची पहिली झलक

जरी ऑडिओ आणि व्हिडिओ पाइपलाइनचे स्वतंत्रपणे बेंचमार्किंग केलेले नसले तरी, टेक्स्ट कोअरने एक प्राथमिक तपासणी (sanity check) यशस्वीरीत्या पार केली आहे:

  • कोडिंग: मॉडेलने एक क्लासिक “merge intervals” समस्या सोडवली आणि O(n log n) कॉम्प्लेक्सिटीसह अल्गोरिदम तयार केला, ज्यावरून हे सिद्ध होते की ते अल्गोरिदमिक मर्यादा समजू शकते.
  • तर्कशक्ती (Reasoning): त्याने चार स्पष्ट गणनांमध्ये बहु-स्तरीय गणिती शब्दसमस्या सोडवली, ज्यामुळे त्याची चेन-ऑफ-थॉट (chain-of-thought) क्षमता दिसून येते.
  • स्ट्रक्चर्ड आउटपुट: इनव्हॉइस इमेजच्या वर्णनावरून, त्याने लाइन आयटम्स, एकूण रक्कम आणि तारखांसह योग्य फॉरमॅटमध्ये JSON ऑब्जेक्ट तयार केला.

मजबूत टेक्स्ट फाउंडेशन महत्त्वाचे आहे कारण तीच ट्रान्सफॉर्मर आर्किटेक्चर मल्टीमोडल पाथवेजना आधार देते. जर भाषेचा भाग चुकला, तर ऑडिओ किंवा व्हिडिओ क्यूज एकत्र करण्याची मॉडेलची क्षमता मर्यादित होईल.

गोपनीयता-प्रथम वापर (Privacy-first use cases)

ज्या उद्योगांना रॉ मीडिया स्वतःच्या अंतर्गत सर्व्हरवर ठेवणे आवश्यक आहे, ते आता खालील गोष्टींसाठी एकच, सेल्फ-होस्टेड स्टॅक वापरू शकतात:

  • मीटिंग इंटेलिजन्स: रेकॉर्डिंग थर्ड-पार्टी सर्व्हिसकडे न पाठवता सारांश (summaries), ॲक्शन-आयटम एक्सट्रॅक्शन, स्पीकर ॲट्रिब्यूशन आणि सेंटीमेंट अनालिसिस करणे.
  • कॉल ॲनालिटिक्स: रिअल टाइममध्ये ताण, निराशा किंवा कंप्लायन्सशी संबंधित कीवर्ड्स शोधणे.
  • व्हॉइस इंटरफेस: असे चॅटबॉट्स तयार करणे जे टोन समजून घेऊ शकतात आणि योग्य व्होकल इन्फ्लेक्शनसह प्रतिसाद देऊ शकतात.
  • व्हिडिओ अनालिसिस: वेबिनार दरम्यान हावभाव, स्लाइड बदल किंवा स्क्रीनवरील रेखाचित्रे ओळखणे.

तीन वेगळ्या व्हेंडर सोल्यूशन्सऐवजी एकच मॉडेल वापरल्यामुळे इंटिग्रेशनचा ओव्हरहेड कमी होतो आणि डेटा-लीकेजचे धोके कमी होतात.

सावधानता आणि काय तपासावे

ऑडिओ आणि व्हिडिओ क्षमता अद्याप उत्पादकाचे दावे आहेत; कोणतेही स्वतंत्र मोजमाप प्रसिद्ध करण्यात आलेले नाही. संभाव्य वापरकर्त्यांनी प्रोडक्शन वर्कलोड्ससाठी वचनबद्ध होण्यापूर्वी प्रतिनिधी डेटासेटवर स्वतःचे बेंचमार्क चालवावेत.

किंमत पारदर्शक असली तरी, ती प्रति-टोकन आहे.

पुढील लक्ष देण्यासारख्या गोष्टी

  • बेंचमार्क रिलीज: ऑडिओ/व्हिडिओ टोकनायझेशन गुणवत्ता, लॅटन्सी आणि मेमरी फूटप्रिंटचे थर्ड-पार्टी मूल्यांकन.
  • टूलिंग इकोसिस्टम: लोकप्रिय ऑडिओ कोडेक्स आणि व्हिडिओ कंटेनर्ससाठी ओपन-सोर्स अडॅप्टर्स जे थेट MiMo V2.5 मध्ये फीड होतील.
  • नियामक प्रतिसाद (Regulatory feedback): डेटा-प्रायव्हसी नियामक क्लाउड API च्या तुलनेत सेल्फ-होस्टेड ओपन-वेट मॉडेल्सना पुरेसा सुरक्षा उपाय मानतात का.
  • कम्युनिटी योगदान: वेट्स सार्वजनिक असल्याने, कम्युनिटी हे मॉडेल विशिष्ट क्षेत्रांसाठी (उदा. मेडिकल डिक्टेशन, लीगल डिपॉझिशन्स) फाईन-ट्यून करू शकते.

MiMo V2.5 चर्चेचा विषय "multimodal glue" कडून "multimodal brain" कडे नेतो, जे कॉर्पोरेट फायरवॉलच्या मागे चालू शकते. त्याचे 'open-weight' स्वरूप गोपनीयता-संवेदनशील संस्थांसाठी अडथळे कमी करते, परंतु आश्वासित ऑडिओ/व्हिडिओ फिडेलिटीला (fidelity) अजूनही पुराव्याची गरज आहे. जोपर्यंत स्वतंत्र चाचण्या या दाव्यांची पुष्टी करत नाहीत, तोपर्यंत या मॉडेलचे सर्वात मोठे वैशिष्ट्य म्हणजे त्याचे अवाढव्य कॉन्टेक्स्ट विंडो (context window) आणि अनेक AI सेवा एकाच, सेल्फ-होस्टेड स्टॅकमध्ये एकत्रित करण्याची शक्यता.