Xiaomi MiMo V2.5 പുറത്തിറക്കി; ഓഡിയോ, ചിത്രങ്ങൾ, വീഡിയോ എന്നിവയെ നേറ്റീവ് ടോക്കണുകളായി (native tokens) പരിഗണിക്കുന്ന ഈ ഓപ്പൺ-വെയ്റ്റ് മൾട്ടിമോഡൽ മോഡലിന് 1.05 മില്യൺ ടോക്കണുകൾ ഉൾക്കൊള്ളാൻ കഴിയുന്ന കോൺടെക്സ്റ്റ് വിൻഡോ (context window) ഉണ്ട്. ഇതിന്റെ വിലവിവരപ്പട്ടിക പ്രകാരം ഓരോ മില്യൺ ഇൻപുട്ട് ടോക്കണുകൾക്കും $0.14 ഡോളറും, ഓരോ മില്യൺ ഔട്ട്പുട്ട് ടോക്കണുകൾക്കും $0.28 ഡോളറുമാണ് നിരക്ക്. ഈ ചെലവ് ഘടന ദീർഘനേരത്തെ മീറ്റിംഗുകളോ വീഡിയോ സ്ട്രീമുകളോ ഒരൊറ്റ പ്രോംപ്റ്റിൽ പ്രവർത്തിപ്പിക്കാൻ സാധ്യമാക്കുന്നു.
എന്തുകൊണ്ടാണ് “open-weight” പ്രധാനമാകുന്നത്?
ഭൂരിഭാഗം മൾട്ടിമോഡൽ AI-കളും വ്യത്യസ്തമായ ഫ്രണ്ട്-എൻഡുകൾ സംയോജിപ്പിച്ചാണ് പ്രവർത്തിക്കുന്നത്: ഒരു സ്പീച്ച്-ടു-ടെക്സ്റ്റ് എൻജിൻ, ഒരു ഇമേജ്-ക്യാപ്ഷനിംഗ് മോഡൽ എന്നിവ വഴി ലഭിക്കുന്ന ടെക്സ്റ്റ് ഒരു ലാർജ് ലാംഗ്വേജ് മോഡലിലേക്ക് (LLM) നൽകുന്നു. ഇവിടെ LLM-ന് ഒരിക്കലും യഥാർത്ഥ വേവ്ഫോം (waveform) അല്ലെങ്കിൽ പിക്സൽ ഡാറ്റ നേരിട്ട് കാണാൻ കഴിയില്ല, അതിനാൽ ശബ്ദത്തിലെ വ്യതിയാനങ്ങൾ (tone), ഇടവേളകൾ (pauses) അല്ലെങ്കിൽ ആംഗ്യങ്ങൾ (gestures) എന്നിവ നഷ്ടപ്പെട്ടേക്കാം. എന്നാൽ MiMo V2.5 ഓഡിയോയും വീഡിയോയും നേരിട്ട് സ്വീകരിക്കുന്നതിനാൽ സമയം (timing), ശബ്ദവ്യതിയാനം (intonation), വിഷ്വൽ സൂചനകൾ എന്നിവ കൃത്യമായി നിലനിർത്തുന്നുവെന്ന് Xiaomi അവകാശപ്പെടുന്നു. സിദ്ധാന്തപരമായി, ഒരു ഫോൺ കോളിലെ നെടുവീർപ്പ് തിരിച്ചറിയാനോ, വൈറ്റ്ബോർഡിലെ ഒരു സ്കെച്ച് പിന്തുടരാനോ, അല്ലെങ്കിൽ ഇടവേളകളില്ലാതെ സംസാരിക്കുന്നവരെ തിരിച്ചറിയാനോ ഒരു ഇടനില ട്രാൻസ്ക്രിപ്ഷൻ ഘട്ടമില്ലാതെ തന്നെ ഈ മോഡലിന് സാധിക്കും.
മോഡലിന്റെ വെയ്റ്റുകൾ (weights) പരസ്യമായി ലഭ്യമായതിനാൽ, സ്ഥാപനങ്ങൾക്ക് ഇത് ഡൗൺലോഡ് ചെയ്ത് സ്വന്തം സെർവറുകളിൽ (on-premise) പ്രവർത്തിപ്പിക്കാൻ കഴിയും. ഇത് ഡാറ്റാ സുരക്ഷയ്ക്ക് പ്രാധാന്യം നൽകുന്ന ഹെൽത്ത് കെയർ, ഫിനാൻസ് തുടങ്ങിയ മേഖലകൾ ക്ലൗഡ് API-കളിലേക്ക് നേരിട്ട് മീഡിയ ഫയലുകൾ അയക്കുന്നതിലെ ആശങ്ക ഒഴിവാക്കാൻ സഹായിക്കുന്നു.
സാങ്കേതിക വിവരങ്ങൾ
- കോൺടെക്സ്റ്റ് വിൻഡോ (Context window): 1.05 മില്യൺ ടോക്കണുകൾ; മണിക്കൂറുകളോളം നീളുന്ന ഒരു മീറ്റിംഗോ അല്ലെങ്കിൽ ഒരു ഡോക്യുമെന്ററിയോ ഒരൊറ്റ റിക്വസ്റ്റിൽ ഉൾക്കൊള്ളാൻ ഇത് മതിയാകും.
- വില: ഓരോ മില്യൺ ഇൻപുട്ട് ടോക്കണുകൾക്കും $0.14, ഓരോ മില്യൺ ഔട്ട്പുട്ട് ടോക്കണുകൾക്കും $0.28.
- മോഡാലിറ്റികൾ (Modalities): ഓഡിയോ, ഇമേജ്, വീഡിയോ, കൂടാതെ സാധാരണ ടെക്സ്റ്റ് കൈകാര്യം ചെയ്യാനുള്ള ശേഷിയും.
ഇതിലെ വലിയ കോൺടെക്സ്റ്റ് വിൻഡോയാണ് ഏറ്റവും ശ്രദ്ധേയമായ കാര്യം. പരമ്പരാഗത LLM-കൾ ഏതാനും ആയിരം ടോക്കണുകളിൽ പരിമിതപ്പെടുമ്പോൾ, ഡെവലപ്പർമാർക്ക് ദീർഘമായ റെക്കോർഡിംഗുകളെ കഷണങ്ങളാക്കി മാറ്റേണ്ടി വരുന്നു. എന്നാൽ MiMo V2.5 ഉപയോഗിച്ച്, ഒരു മീറ്റിംഗിനെ മുറിച്ചു മാറ്റാതെ തന്നെ ഒരൊറ്റ പ്രോംപ്റ്റിൽ ഉൾപ്പെടുത്താം.
ടെക്സ്റ്റ് എൻജിനെക്കുറിച്ചുള്ള നേരിട്ടുള്ള നിരീക്ഷണം
ഓഡിയോ, വീഡിയോ പൈപ്പ്ലൈനുകൾ സ്വതന്ത്രമായി ബെഞ്ച്മാർക്ക് ചെയ്തിട്ടില്ലെങ്കിലും, ടെക്സ്റ്റ് കോർ (text core) നടത്തിയ പ്രാഥമിക പരിശോധനകളിൽ മികച്ച ഫലം നൽകി:
- കോഡിംഗ്: മോഡൽ ഒരു ക്ലാസിക് “merge intervals” പ്രശ്നം പരിഹരിക്കുകയും
O(n log n)കോംപ്ലക്സിറ്റിയുള്ള ഒരു അൽഗോരിതം നിർമ്മിക്കുകയും ചെയ്തു. ഇത് അൽഗോരിതമിക് നിയന്ത്രണങ്ങൾ മനസ്സിലാക്കാൻ മോഡലിന് കഴിയുമെന്ന് തെളിയിക്കുന്നു. - റീസണിംഗ് (Reasoning): നാല് ഘട്ടങ്ങളിലായി ഒരു മാത്ത് വേർഡ് പ്രോബ്ലം പരിഹരിച്ചതിലൂടെ ഇതിന്റെ 'chain-of-thought' ശേഷി തെളിയിക്കപ്പെട്ടു.
- സ്ട്രക്ചേർഡ് ഔട്ട്പുട്ട്: ഒരു ഇൻവോയ്സ് ഇമേജിന്റെ വിവരണം നൽകിയപ്പോൾ, അത് കൃത്യമായ ഫോർമാറ്റിലുള്ള ഒരു JSON ഒബ്ജക്റ്റ് (ലൈൻ ഐറ്റംസ്, ടോട്ടൽ, തീയതി എന്നിവ സഹിതം) പുറപ്പെടുവിച്ചു.
ശക്തമായ ഒരു ടെക്സ്റ്റ് അടിത്തറ പ്രധാനമാണ്, കാരണം ഇതേ ട്രാൻസ്ഫോർമർ ആർക്കിടെക്ചർ (transformer architecture) ആണ് മൾട്ടിമോഡൽ പാതകൾക്കും അടിസ്ഥാനമായിരിക്കുന്നത്. ഭാഷാപരമായ കാര്യങ്ങളിൽ പിഴവ് സംഭവിച്ചാൽ, ഓഡിയോ അല്ലെങ്കിൽ വീഡിയോ സൂചനകൾ സംയോജിപ്പിക്കാനുള്ള മോഡലിന്റെ ശേഷി പരിമിതമാകും.
സ്വകാര്യതയ്ക്ക് മുൻഗണന നൽകുന്ന ഉപയോഗങ്ങൾ
ഡാറ്റ സ്വന്തം സ്ഥാപനങ്ങളിൽ തന്നെ സൂക്ഷിക്കേണ്ട കമ്പനികൾക്ക് ഇനി താഴെ പറയുന്ന കാര്യങ്ങൾക്കായി ഒരു സിംഗിൾ സെൽഫ്-ഹോസ്റ്റഡ് സ്റ്റാക്ക് ഉപയോഗിക്കാം:
- മീറ്റിംഗ് ഇന്റലിജൻസ്: റെക്കോർഡിംഗുകൾ മൂന്നാം കക്ഷി സർവീസുകളിലേക്ക് അയക്കാതെ തന്നെ സംഗ്രഹങ്ങൾ (summaries), ആക്ഷൻ ഐറ്റംസ് വേർതിരിച്ചെടുക്കൽ, സ്പീക്കർ തിരിച്ചറിയൽ, സെന്റിമെന്റ് അനാലിസിസ് എന്നിവ നടത്താം.
- കോൾ അനലിറ്റിക്സ്: സംഭാഷണങ്ങളിൽ സമ്മർദ്ദം, നിരാശ അല്ലെങ്കിൽ നിയമപരമായ കീവേഡുകൾ എന്നിവ തത്സമയം തിരിച്ചറിയാം.
- വോയ്സ് ഇന്റർഫേസുകൾ: ശബ്ദവ്യതിയാനങ്ങൾ മനസ്സിലാക്കാനും അനുയോജ്യമായ രീതിയിൽ പ്രതികരിക്കാനും കഴിയുന്ന ചാറ്റ്ബോട്ടുകൾ നിർമ്മിക്കാം.
- വീഡിയോ അനാലിസിസ്: വെബിനാറുകൾക്കിടയിൽ ആംഗ്യങ്ങൾ, സ്ലൈഡ് മാറ്റങ്ങൾ അല്ലെങ്കിൽ സ്ക്രീനിലെ ഡ്രോയിംഗുകൾ എന്നിവ തിരിച്ചറിയാം.
മൂന്ന് വ്യത്യസ്ത വെണ്ടർ സൊല്യൂഷനുകൾക്ക് പകരം ഒരു മോഡൽ മാത്രം ഉപയോഗിക്കുന്നത് സംയോജനത്തിനുള്ള പ്രയാസങ്ങൾ കുറയ്ക്കാനും ഡാറ്റാ ചോർച്ചയ്ക്കുള്ള സാധ്യതകൾ ഇല്ലാതാക്കാനും സഹായിക്കുന്നു.
ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങളും പരിശോധിക്കേണ്ടവയും
ഓഡിയോ, വീഡിയോ ശേഷികൾ നിലവിൽ നിർമ്മാതാക്കളുടെ അവകാശവാദങ്ങൾ മാത്രമാണ്; അവയെക്കുറിച്ച് സ്വതന്ത്രമായ അളവുകോലുകൾ പ്രസിദ്ധീകരിച്ചിട്ടില്ല. അതിനാൽ, ഉപയോഗിക്കാൻ ഉദ്ദേശിക്കുന്നവർ പ്രൊഡക്ഷൻ വർക്ക് ലോഡുകളിലേക്ക് കടക്കുന്നതിന് മുമ്പ് സ്വന്തമായി ബെഞ്ച്മാർക്കുകൾ നടത്തേണ്ടതാണ്.
വില സുതാര്യമാണെങ്കിലും, അത് ടോക്കൺ അടിസ്ഥാനത്തിലാണ് കണക്കാക്കുന്നത്.
ശ്രദ്ധിക്കേണ്ട അടുത്ത കാര്യങ്ങൾ
- ബെഞ്ച്മാർക്ക് റിലീസുകൾ: ഓഡിയോ/വീഡിയോ ടോക്കണൈസേഷൻ ഗുണനിലവാരം, ലേറ്റൻസി (latency), മെമ്മറി ഉപയോഗം എന്നിവയെക്കുറിച്ചുള്ള മൂന്നാം കക്ഷി മൂല്യനിർണ്ണയങ്ങൾ.
- ടൂളിംഗ് ഇക്കോസിസ്റ്റം: MiMo V2.5-ലേക്ക് നേരിട്ട് ഡാറ്റ നൽകാൻ കഴിയുന്ന പ്രശസ്തമായ ഓഡിയോ കോഡെക്കുകൾക്കും വീഡിയോ കണ്ടെയ്നറുകൾക്കുമായുള്ള ഓപ്പൺ സോഴ്സ് അഡാപ്റ്ററുകൾ.
- റെഗുലേറ്ററി ഫീഡ്ബാക്ക്: ക്ലൗഡ് API-കളെ അപേക്ഷിച്ച് സെൽഫ്-ഹോസ്റ്റഡ് ഓപ്പൺ-വെയ്റ്റ് മോഡലുകൾ ഡാറ്റാ പ്രൈവസി നിയമങ്ങൾ പാലിക്കുന്നുണ്ടോ എന്നതിനെക്കുറിച്ചുള്ള റെഗുലേറ്റർമാരുടെ നിലപാട്.
- കമ്മ്യൂണിറ്റി സംഭാവനകൾ: വെയ്റ്റുകൾ പബ്ലിക് ആയതുകൊണ്ട്, കമ്മ്യൂണിറ്റിക്ക് ഈ മോഡലിനെ പ്രത്യേക മേഖലകൾക്കായി (ഉദാഹരണത്തിന്: മെഡിക്കൽ ഡിക്കേഷൻ, ലീഗൽ ഡെപ്പോസിഷൻ) ഫൈൻ ട്യൂൺ ചെയ്യാൻ സാധിക്കും.
MiMo V2.5 ചർച്ചകളെ "മൾട്ടിമോഡൽ ഗ്ലൂ" എന്നതിലുപരി, ഒരു കോർപ്പറേറ്റ് ഫയർവാളിന് പിന്നിൽ പ്രവർത്തിപ്പിക്കാൻ കഴിയുന്ന "മൾട്ടിമോഡൽ ബ്രെയിൻ" എന്ന നിലയിലേക്ക് എത്തിക്കുന്നു. ഇതിന്റെ ഓപ്പൺ-വെയ്റ്റ് സ്വഭാവം സ്വകാര്യതയ്ക്ക് മുൻഗണന നൽകുന്ന സ്ഥാപനങ്ങൾക്ക് ഇത് ഉപയോഗിക്കുന്നത് എളുപ്പമാക്കുന്നുണ്ടെങ്കിലും, വാഗ്ദാനം ചെയ്തിട്ടുള്ള ഓഡിയോ/വീഡിയോ ഗുണമേന്മ ഇനിയും തെളിയിക്കപ്പെടേണ്ടതുണ്ട്. സ്വതന്ത്രമായ പരിശോധനകൾ ഈ അവകാശവാദങ്ങൾ സ്ഥിരീകരിക്കുന്നത് വരെ, ഈ മോഡലിന്റെ ഏറ്റവും വലിയ ആകർഷണം അതിന്റെ വിശാലമായ കോൺടെക്സ്റ്റ് വിൻഡോയും (massive context window), ഒന്നിലധികം AI സേവനങ്ങളെ ഒരൊറ്റ സെൽഫ്-ഹോസ്റ്റഡ് സ്റ്റാക്കിലേക്ക് (self-hosted stack) ഏകോപിപ്പിക്കാനുള്ള സാധ്യതയുമാണ്.
