Xiaomi ਨੇ MiMo V2.5 ਲਾਂਚ ਕੀਤਾ ਹੈ, ਜੋ ਕਿ ਇੱਕ open-weight multimodal ਮਾਡਲ ਹੈ। ਇਹ ਆਡੀਓ, ਚਿੱਤਰਾਂ (images) ਅਤੇ ਵੀਡੀਓ ਨੂੰ native tokens ਵਜੋਂ ਵਰਤਦਾ ਹੈ ਅਤੇ 1.05-ਮਿਲੀਅਨ-ਟੋਕਨ ਦਾ context window ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ। ਕੀਮਤਾਂ ਵਿੱਚ 1 ਮਿਲੀਅਨ input tokens ਲਈ $0.14 ਅਤੇ 1 ਮਿਲੀਅਨ output tokens ਲਈ $0.28 ਦੱਸਿਆ ਗਿਆ ਹੈ, ਇਹ ਅਜਿਹਾ ਲਾਗਤ ਢਾਂਚਾ ਹੈ ਜੋ ਇੱਕ ਸਿੰਗਲ ਪ੍ਰੋਂਪਟ ਵਿੱਚ ਲੰਬੀਆਂ ਮੀਟਿੰਗਾਂ ਜਾਂ ਵੀਡੀਓ ਸਟ੍ਰੀਮਾਂ ਚਲਾਉਣਾ ਸੰਭਵ ਬਣਾਉਂਦਾ ਹੈ।

“open-weight” ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

ਜ਼ਿਆਦਾਤਰ multimodal AI ਵੱਖ-ਵੱਖ front-ends ਨੂੰ ਜੋੜ ਕੇ ਬਣਾਏ ਜਾਂਦੇ ਹਨ: ਇੱਕ speech-to-text engine, ਇੱਕ image-captioning ਮਾਡਲ, ਅਤੇ ਫਿਰ ਨਤੀਜੇ ਵਜੋਂ ਮਿਲੀ ਟੈਕਸਟ ਨੂੰ ਇੱਕ large language model (LLM) ਵਿੱਚ ਭੇਜਿਆ ਜਾਂਦਾ ਹੈ। LLM ਕਦੇ ਵੀ raw waveform ਜਾਂ pixel ਡੇਟਾ ਨਹੀਂ ਦੇਖਦਾ, ਇਸ ਲਈ ਲਹਿਜਾ (tone), ਵਿਰਾਮ (pauses) ਜਾਂ ਇਸ਼ਾਰੇ (gestures) ਵਰਗੇ ਸੂਖਮ ਅੰਤਰ ਗੁਆਚ ਸਕਦੇ ਹਨ। Xiaomi ਦਾ ਦਾਅਵਾ ਹੈ ਕਿ MiMo V2.5 ਆਡੀਓ ਅਤੇ ਵੀਡੀਓ ਨੂੰ ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਅਪਣਾਉਂਦਾ ਹੈ, ਜਿਸ ਨਾਲ timing, intonation ਅਤੇ visual cues ਬਰਕਰਾਰ ਰਹਿੰਦੇ ਹਨ। ਸਿਧਾਂਤਕ ਤੌਰ 'ਤੇ, ਇਹ ਮਾਡਲ ਨੂੰ ਫ਼ੋਨ ਕਾਲ ਵਿੱਚ ਇੱਕ ਹਾਉਕੇ (sigh) ਨੂੰ ਪਛਾਣਨ, ਵ੍ਹਾਈਟਬੋਰਡ 'ਤੇ ਬਣਾਏ ਗਏ ਸਕੈਚ ਨੂੰ ਫੋਲੋ ਕਰਨ, ਜਾਂ ਕਿਸੇ ਵਿਚਕਾਰਲੇ transcription ਪੜਾਅ ਤੋਂ ਬਿਨਾਂ ਇੱਕੋ ਸਮੇਂ ਬੋਲਣ ਵਾਲੇ ਬੁਲਾਰਿਆਂ ਵਿੱਚ ਅੰਤਰ ਕਰਨ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ।

ਕਿਉਂਕਿ ਮਾਡਲ ਦੇ weights ਖੁੱਲ੍ਹੇ ਤੌਰ 'ਤੇ ਜਾਰੀ ਕੀਤੇ ਗਏ ਹਨ, ਸੰਸਥਾਵਾਂ ਇਸਨੂੰ ਡਾਊਨਲੋਡ ਕਰਕੇ ਆਪਣੇ ਆਪ (on-premise) ਚਲਾ ਸਕਦੀਆਂ ਹਨ। ਇਹ ਕਲਾਊਡ APIs ਨੂੰ raw media ਭੇਜਣ ਦੀ ਆਮ ਪ੍ਰਥਾ ਤੋਂ ਬਚਾਉਂਦਾ ਹੈ, ਜੋ ਕਿ ਅਜਿਹਾ ਕਦਮ ਹੈ ਜਿਸ ਨੂੰ ਲੈ ਕੇ ਕਈ ਨਿਯਮਿਤ ਖੇਤਰ—ਜਿਵੇਂ ਕਿ ਸਿਹਤ ਸੰਭਾਲ (healthcare) ਅਤੇ ਵਿੱਤ (finance)—ਝਿਜਕਦੇ ਹਨ ਜਾਂ ਜਿਸ ਦੀ ਇਜਾਜ਼ਤ ਨਹੀਂ ਹੈ।

ਤਕਨੀਕੀ ਮੁੱਖ ਅੰਕੜੇ

  • Context window: 1.05 ਮਿਲੀਅਨ ਟੋਕਨ, ਜੋ ਇੱਕ ਬਹੁ-ਘੰਟੇ ਦੀ ਮੀਟਿੰਗ ਜਾਂ ਇੱਕ ਪੂਰੀ ਡਾਕੂਮੈਂਟਰੀ ਨੂੰ ਇੱਕੋ ਰਿਕਵੈਸਟ ਵਿੱਚ ਸਮਾਉਣ ਲਈ ਕਾਫ਼ੀ ਹੈ।
  • Pricing: $0.14 ਪ੍ਰਤੀ ਮਿਲੀਅਨ input tokens, $0.28 ਪ੍ਰਤੀ ਮਿਲੀਅਨ output tokens।
  • Modalities: ਆਡੀਓ, ਚਿੱਤਰ (image), ਵੀਡੀਓ, ਅਤੇ ਮਿਆਰੀ ਟੈਕਸਟ ਹੈਂਡਲਿੰਗ।

ਵੱਡਾ context window ਸਭ ਤੋਂ ਵੱਧ ਧਿਆਨ ਖਿੱਚਦਾ ਹੈ। ਰਵਾਇਤੀ LLMs ਕੁਝ ਹਜ਼ਾਰ ਟੋਕਨਾਂ ਤੱਕ ਹੀ ਸੀਮਤ ਹੁੰਦੇ ਹਨ, ਜਿਸ ਕਾਰਨ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਲੰਬੀਆਂ ਰਿਕਾਰਡਿੰਗਾਂ ਨੂੰ ਟੁਕੜਿਆਂ ਵਿੱਚ ਵੰਡਣਾ ਪੈਂਦਾ ਹੈ ਜਾਂ ਵੀਡੀਓ ਨੂੰ ਛੋਟੀਆਂ ਕਲਿੱਪਾਂ ਵਿੱਚ ਵੰਡਣਾ ਪੈਂਦਾ ਹੈ। MiMo V2.5 ਦੇ ਨਾਲ, ਇੱਕ ਸਿੰਗਲ ਪ੍ਰੋਂਪਟ ਵਿੱਚ ਮੀਟਿੰਗ ਨੂੰ ਟੁਕੜਿਆਂ ਵਿੱਚ ਵੰਡੇ ਬਿਨਾਂ ਕਈ ਘੰਟਿਆਂ ਦੀ ਮੀਟਿੰਗ ਨੂੰ ਸ਼ਾਮਲ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ।

ਟੈਕਸਟ ਇੰਜਣ ਦੀ ਪਹਿਲੀ ਝਲਕ

ਹਾਲਾਂਕਿ ਆਡੀਓ ਅਤੇ ਵੀਡੀਓ ਪਾਈਪਲਾਈਨਾਂ ਦਾ ਸੁਤੰਤਰ ਤੌਰ 'ਤੇ ਬੈਂਚਮਾਰਕ ਨਹੀਂ ਕੀਤਾ ਗਿਆ ਹੈ, ਪਰ ਟੈਕਸਟ ਕੋਰ ਨੇ ਇੱਕ ਤੇਜ਼ ਸੈਨਿਟੀ ਚੈੱਕ (sanity check) ਪਾਸ ਕੀਤਾ ਹੈ:

  • Coding: ਮਾਡਲ ਨੇ ਇੱਕ ਕਲਾਸਿਕ “merge intervals” ਸਮੱਸਿਆ ਨੂੰ ਹੱਲ ਕੀਤਾ ਅਤੇ O(n log n) ਕੰਪਲੈਕਸਿਟੀ ਵਾਲਾ ਇੱਕ ਐਲਗੋਰਿਦਮ ਤਿਆਰ ਕੀਤਾ, ਜੋ ਇਹ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਇਹ ਐਲਗੋਰਿਦਮਿਕ ਪਾਬੰਦੀਆਂ ਨੂੰ ਸਮਝ ਸਕਦਾ ਹੈ।
  • Reasoning: ਇਸਨੇ ਚਾਰ ਸਾਫ਼ ਗਣਨਾਵਾਂ ਵਿੱਚ ਇੱਕ ਬਹੁ-ਪੜਾਵੀ ਗਣਿਤ ਦੀ ਸਮੱਸਿਆ ਦਾ ਜਵਾਬ ਦਿੱਤਾ, ਜੋ ਕਿ chain-of-thought ਸਮਰੱਥਾ ਨੂੰ ਪ੍ਰਦਰਸ਼ਿਤ ਕਰਦਾ ਹੈ।
  • Structured output: ਇੱਕ ਇਨਵੌਇਸ (invoice) ਚਿੱਤਰ ਦੇ ਵੇਰਵੇ ਦੇਣ 'ਤੇ, ਇਸਨੇ ਲਾਈਨ ਆਈਟਮਾਂ, ਕੁੱਲ ਰਕਮ ਅਤੇ ਮਿਤੀਆਂ ਦੇ ਨਾਲ ਸਹੀ ਫਾਰਮੈਟ ਵਾਲਾ JSON ਆਬਜੈਕਟ ਜਾਰੀ ਕੀਤਾ।

ਇੱਕ ਮਜ਼ਬੂਤ ਟੈਕਸਟ ਬੁਨਿਆਦ ਮਹੱਤਵਪੂਰਨ ਹੈ ਕਿਉਂਕਿ ਉਹੀ transformer ਆਰਕੀਟੈਕਚਰ multimodal ਮਾਰਗਾਂ ਦਾ ਅਧਾਰ ਹੈ। ਜੇਕਰ ਭਾਸ਼ਾ ਵਾਲਾ ਪੱਖ ਕਮਜ਼ੋਰ ਹੁੰਦਾ ਹੈ, ਤਾਂ ਆਡੀਓ ਜਾਂ ਵੀਡੀਓ ਸੰਕੇਤਾਂ ਨੂੰ ਜੋੜਨ ਦੀ ਮਾਡਲ ਦੀ ਸਮਰੱਥਾ ਸੀਮਤ ਹੋਵੇਗੀ।

ਪ੍ਰਾਈਵੇਸੀ-ਪਹਿਲ ਵਾਲੇ ਵਰਤੋਂ ਦੇ ਮਾਮਲੇ

ਉਹ ਉਦਯੋਗ ਜੋ raw media ਨੂੰ ਆਪਣੇ ਅੰਦਰ ਹੀ ਰੱਖਣਾ ਚਾਹੁੰਦੇ ਹਨ, ਉਹ ਹੁਣ ਇਹਨਾਂ ਲਈ ਇੱਕ ਸਿੰਗਲ, self-hosted ਸਟੈਕ ਦੀ ਕਲਪਨਾ ਕਰ ਸਕਦੇ ਹਨ:

  • Meeting intelligence: ਰਿਕਾਰਡਿੰਗਾਂ ਨੂੰ ਕਿਸੇ ਤੀਜੀ-ਪਾਰਟੀ ਸੇਵਾ ਨੂੰ ਭੇਜੇ ਬਿਨਾਂ, ਸਾਰ (summaries), ਐਕਸ਼ਨ-ਆਈਟਮ ਕੱਢਣਾ, ਬੁਲਾਰੇ ਦੀ ਪਛਾਣ, ਅਤੇ ਭਾਵਨਾਤਮਕ ਵਿਸ਼ਲੇਸ਼ਣ (sentiment analysis)।
  • Call analytics: ਰੀਅਲ-ਟਾਈਮ ਵਿੱਚ ਤਣਾਅ, ਨਿਰਾਸ਼ਾ, ਜਾਂ ਪਾਲਣਾ (compliance) ਨਾਲ ਸਬੰਧਤ ਕੀਵਰਡਸ ਦਾ ਪਤਾ ਲਗਾਉਣਾ।
  • Voice interfaces: ਅਜਿਹੇ ਚੈਟਬੋਟ ਬਣਾਉਣਾ ਜੋ ਲਹਿਜੇ ਨੂੰ ਸਮਝ ਸਕਦੇ ਹਨ ਅਤੇ ਉਚਿਤ ਆਵਾਜ਼ ਦੇ ਉਤਾਰ-ਚੜ੍ਹਾਅ ਨਾਲ ਜਵਾਬ ਦੇ ਸਕਦੇ ਹਨ।
  • Video analysis: ਵੈਬਿਨਾਰ ਦੌਰਾਨ ਇਸ਼ਾਰਿਆਂ, ਸਲਾਈਡਾਂ ਦੇ ਬਦਲਾਅ, ਜਾਂ ਸਕ੍ਰੀਨ 'ਤੇ ਬਣਾਏ ਗਏ ਡਰਾਇੰਗਾਂ ਨੂੰ ਪਛਾਣਨਾ।

ਤਿੰਨ ਵੱਖ-

MiMo V2.5 ਗੱਲਬਾਤ ਨੂੰ "multimodal glue" ਤੋਂ "multimodal brain" ਦੇ ਪੱਧਰ 'ਤੇ ਲੈ ਜਾਂਦੀ ਹੈ, ਜੋ ਕਿ ਇੱਕ ਕਾਰਪੋਰੇਟ ਫਾਇਰਵਾਲ ਦੇ ਪਿੱਛੇ ਚਲਾਇਆ ਜਾ ਸਕਦਾ ਹੈ। ਇਸਦੀ open-weight ਪ੍ਰਕਿਰਤੀ ਪ੍ਰਾਈਵੇਸੀ ਪ੍ਰਤੀ ਸੰਵੇਦਨਸ਼ੀਲ ਸੰਸਥਾਵਾਂ ਲਈ ਰੁਕਾਵਟਾਂ ਨੂੰ ਘਟਾਉਂਦੀ ਹੈ, ਪਰ ਵਾਅਦਾ ਕੀਤੀ ਗਈ ਆਡੀਓ/ਵੀਡੀਓ ਫਿਡੈਲਿਟੀ (fidelity) ਨੂੰ ਅਜੇ ਵੀ ਸਬੂਤ ਦੀ ਲੋੜ ਹੈ। ਜਦੋਂ ਤੱਕ ਸੁਤੰਤਰ ਟੈਸਟ ਇਨ੍ਹਾਂ ਦਾਅਵਿਆਂ ਦੀ ਪੁਸ਼ਟੀ ਨਹੀਂ ਕਰਦੇ, ਮਾਡਲ ਦੀ ਸਭ ਤੋਂ ਵੱਡੀ ਖ਼ੂਬੀ ਇਸਦਾ ਵਿਸ਼ਾਲ context window ਅਤੇ ਕਈ AI ਸੇਵਾਵਾਂ ਨੂੰ ਇੱਕ ਸਿੰਗਲ, ਸੈਲਫ-ਹੋਸਟਡ ਸਟੈਕ ਵਿੱਚ ਇਕੱਠਾ ਕਰਨ ਦੀ ਸੰਭਾਵਨਾ ਬਣੀ ਹੋਈ ਹੈ।