Xiaomi, MiMo-V2.5 என்ற புதிய open-weight multimodal மாடலை அறிமுகப்படுத்தியுள்ளது. இது ஆடியோ, படம் மற்றும் வீடியோ ஆகியவற்றைத் தனித்துவமான (native) tokens ஆகக் கையாள்கிறது. இது 1,050,000-token context window வசதியையும், பயன்படுத்திய அளவிற்கு ஏற்ப (pay-as-you-go) ஒரு மில்லியன் input tokens-களுக்கு $0.14 மற்றும் ஒரு மில்லியன் output tokens-களுக்கு $0.28 என்ற விலையையும் வழங்குகிறது. இது நிறுவனங்களின் உள்ளூர் பயன்பாட்டிற்கான (on-premise), ஊடகங்கள் சார்ந்த (media-heavy) AI தேவைகளைக் கருத்தில் கொண்டு உருவாக்கப்பட்டுள்ளது.

ஒரு புதிய multimodal அணுகுமுறை ஏன் முக்கியமானது

தற்போதுள்ள பெரும்பாலான multimodal அமைப்புகள் ஒரு குறுக்குவழியைப் பின்பற்றுகின்றன. அவை முதலில் speech-to-text engine-ஐ இயக்குகின்றன, பின்னர் படங்களை விளக்க உரையாக (captions) மாற்றும் vision model-ஐப் பயன்படுத்துகின்றன, இறுதியாக அந்த உரையை ஒரு large language model (LLM)-க்கு வழங்குகின்றன. இந்த முறையில் LLM-ஆல் அசல் ஒலி அலைகளையோ (sound wave) அல்லது pixel தரவுகளையோ பார்க்க முடியாது; இதனால் ஒரு பெருமூச்சு, ஒரு இடைவெளி, முகத் தசை அசைவு அல்லது கை சைகை போன்ற நுணுக்கங்கள் மறைந்துவிடுகின்றன. MiMo-V2.5 இந்தத் தேவையில்லை: இது ஆடியோ மற்றும் வீடியோவை நேரடியாக “tokens” ஆக உள்வாங்கிக் கொள்கிறது, இதன் மூலம் ஒரு transcript-ஆல் பிடிக்க முடியாத கால அளவு (timing), தொனி (tone) மற்றும் காட்சித் தகவல்களை (visual cues) அப்படியே பாதுகாக்கிறது.

தொழில்நுட்ப விவரங்கள்

  • Token window: 1,050,000 tokens – பல மணிநேரக் கூட்டப் பதிவுகளைத் துண்டுகளாகப் பிரிக்காமலேயே உள்வாங்க போதுமானது.
  • Self-hosting: ஒரு நிறுவனத்தின் சொந்தச் சேவையகங்களிலேயே (servers) இந்த மாடலை நிறுவலாம், இதனால் அசல் ஊடகத் தரவுகள் (raw media) நிறுவனத்திற்கு வெளியே செல்லாது.
  • Pricing: ஒரு மில்லியன் input tokens-களுக்கு $0.14, ஒரு மில்லியன் output tokens-களுக்கு $0.28 – இது பயன்பாட்டிற்கு ஏற்ப மாறும் வெளிப்படையான விலையாகும்.

இதன் text-only மையப்பகுதியைச் சோதனை செய்தபோது, இந்த மாடல் ஒரு வழக்கமான merge-interval coding சிக்கலை எதிர்பார்க்கப்பட்ட O(n log n) algorithm மூலம் தீர்த்தது, ஒரு tank-fill rate கணிதப் பிரச்சனையைத் தர்க்கரீதியாகக் கணக்கிட்டது, மற்றும் ஒரு invoice-லிருந்து பிழையின்றி JSON payload-ஐப் பிரித்தெடுத்தது. அந்தச் சோதனையில் ஆடியோ மற்றும் வீடியோ வழிமுறைகள் (pipelines) பயன்படுத்தப்படவில்லை.

யாருக்குப் பயன் கிடைக்கும்

சுகாதாரம் மற்றும் நிதி போன்ற தனியுரிமைக்கு முக்கியத்துவம் அளிக்கும் துறைகளால் அசல் ஆடியோ அல்லது வீடியோவை மூன்றாம் தரப்பு APIs-க்கு அனுப்ப முடியாது. தரவுகளைத் தங்களின் பாதுகாப்பான நெட்வொர்க்கிற்குள் (firewall) வைத்திருப்பதன் மூலம், MiMo-V2.5 இந்த நிறுவனங்கள் தரவுப் பாதுகாப்பு விதிகளுக்குக் கட்டுப்பட்டு, அதே சமயம் AI சார்ந்த நுண்ணறிவுகளைப் பெற அனுமதிக்கிறது. இதன் சாத்தியமான பயன்பாடுகள்:

  • Meeting intelligence: தனிப்பயனாக்கப்பட்ட transcription நிலை இல்லாமலேயே, முழு வீடியோ பதிவுகளையும் பகுப்பாய்வு செய்து முடிவுகள், எடுக்கப்பட வேண்டிய நடவடிக்கைகள் (action items) மற்றும் பேசுபவரின் உணர்ச்சிகளை (sentiment) கண்டறியலாம்.
  • Call-center analytics: அழைப்பவரின் குரலில் உள்ள விரக்தி, தயக்கம் அல்லது நம்பிக்கையை நிகழ்நேரத்தில் (real time) கண்டறியலாம்.
  • On-device assistants: ஆடியோவை cloud-க்கு அனுப்பாமலேயே, குரலின் தொனியைப் புரிந்துகொண்டு, சொல்லப்படாத உடல்மொழித் தகவல்களுக்கு (non-verbal cues) எதிர்வினையாற்றும் குரல் இடைமுகங்களை (voice interfaces) உருவாக்கலாம்.

நடைமுறைச் சவால்கள்

MiMo-V2.5-ன் வெற்றி அதன் ஆடியோ மற்றும் வீடியோ என்கோடர்களின் (encoders) செயல்திறனைப் பொறுத்தது – இந்தத் தொகுதிகளை ஆசிரியர் இன்னும் சோதனை (benchmark) செய்யவில்லை. நிறுவனங்கள் இதனைப் பயன்பாட்டிற்கு (production) கொண்டு வருவதற்கு முன், தங்களின் சொந்தத் தரவுத் தொகுப்புகளைக் கொண்டு தாமதம் (latency), துல்லியம் மற்றும் வன்பொருள் பயன்பாடு (hardware consumption) ஆகியவற்றைச் சரிபார்க்க வேண்டும். உரையை (text) மட்டும் தேவைப்படும் குழுக்கள், கணினித் திறன் மற்றும் செலவு ஆகிய இரண்டிலும் சிறிய, text-only மாடலையே சிறந்ததாகக் கருதுவார்கள். MiMo-V2.5-ன் open-weight தன்மை காரணமாக அதன் குறியீடுகளும் (code) எடைகளும் (weights) பொதுவில் கிடைக்கின்றன; இது ஆழமான தனிப்பயனாக்கத்திற்கு (customisation) வழிவகுக்கிறது, ஆனால் அதே சமயம் இந்தத் தொழில்நுட்பக் கட்டமைப்பைப் பராமரிக்கவும் பாதுகாக்கவும் நிறுவனத்திற்குள் நிபுணத்துவம் தேவைப்படுகிறது.

சுருக்கம்

MiMo-V2.5 நேரடி ஊடக டோக்கனாக்கம் (native media tokenisation), மிகப்பெரிய context window மற்றும் தெளிவான per-token விலையில் self-hosting வசதிகளை வழங்குகிறது. அசல் ஆடியோ மற்றும் வீடியோவை நிறுவனத்திற்குள்ளேயே வைத்திருக்க வேண்டிய தனியுரிமை சார்ந்த நிறுவனங்களுக்கு, இது ஒரு சிறந்த முன்னோடிப் பாதையை (pilot path) வழங்குகிறது. இதன் உண்மையான மதிப்பு, நிறுவனங்களின் பணிச்சுமையின் கீழ் (enterprise workloads) இதன் ஆடியோ மற்றும் வீடியோ என்கோடர்கள் எவ்வாறு செயல்படுகின்றன மற்றும் self-hosting-ன் செயல்பாட்டுச் செலவுகள் (operational overhead) தற்போதுள்ள AI குழுக்களின் திறன்களுக்குள் அடங்குமா என்பதைப் பொறுத்தே அமையும்.