Xiaomi ਨੇ MiMo-V2.5 ਲਾਂਚ ਕੀਤਾ ਹੈ, ਜੋ ਕਿ ਇੱਕ open-weight multimodal ਮਾਡਲ ਹੈ ਜੋ ਆਡੀਓ, ਇਮੇਜ ਅਤੇ ਵੀਡੀਓ ਨੂੰ native tokens ਵਜੋਂ ਵਰਤਦਾ ਹੈ। ਇਹ 1,050,000-token ਦਾ context window ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ ਅਤੇ ਇਸਦੀ ਕੀਮਤ pay-as-you-go ਮਾਡਲ 'ਤੇ ਅਧਾਰਤ ਹੈ: $0.14 ਪ੍ਰਤੀ ਮਿਲੀਅਨ input tokens ਅਤੇ $0.28 ਪ੍ਰਤੀ ਮਿਲੀਅਨ output tokens। ਇਹ ਉਨ੍ਹਾਂ ਸੰਸਥਾਵਾਂ ਨੂੰ ਧਿਆਨ ਵਿੱਚ ਰੱਖ ਕੇ ਬਣਾਇਆ ਗਿਆ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ on-premise ਅਤੇ media-heavy AI ਦੀ ਲੋੜ ਹੈ।

ਇੱਕ ਨਵਾਂ multimodal ਪਹੁੰਚ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

ਜ਼ਿਆਦਾਤਰ ਮੌਜੂਦਾ multimodal ਸਿਸਟਮ ਇੱਕ ਸ਼ਾਰਟਕੱਟ ਲੈਂਦੇ ਹਨ। ਉਹ ਪਹਿਲਾਂ ਇੱਕ speech-to-text engine ਚਲਾਉਂਦੇ ਹਨ, ਫਿਰ ਇੱਕ vision model ਜੋ ਤਸਵੀਰਾਂ ਨੂੰ captions ਵਿੱਚ ਬਦਲ ਦਿੰਦਾ ਹੈ, ਅਤੇ ਅੰਤ ਵਿੱਚ ਨਤੀਜੇ ਵਜੋਂ ਮਿਲੇ ਟੈਕਸਟ ਨੂੰ ਇੱਕ large language model (LLM) ਵਿੱਚ ਭੇਜ ਦਿੰਦੇ ਹਨ। LLM ਕਦੇ ਵੀ ਅਸਲ sound wave ਜਾਂ pixel data ਨੂੰ ਨਹੀਂ ਦੇਖ ਸਕਦਾ, ਇਸ ਲਈ ਇੱਕ ਹੌਲੀ ਜਿਹੀ ਸਾਹ ਲੈਣ ਦੀ ਆਵਾਜ਼, ਰੁਕਾਵਟ, ਚਿਹਰੇ ਦੇ ਹਾਵ-ਭਾਵ ਜਾਂ ਹੱਥਾਂ ਦੇ ਇਸ਼ਾਰੇ ਵਰਗੇ ਬਾਰੀਕ ਅੰਤਰ ਗੁਆਚ ਜਾਂਦੇ ਹਨ। MiMo-V2.5 ਇਸ ਪੈਰ ਚੜ੍ਹਨ ਦੀ ਲੋੜ ਨੂੰ ਖਤਮ ਕਰਦਾ ਹੈ: ਇਹ ਆਡੀਓ ਅਤੇ ਵੀਡੀਓ ਨੂੰ ਸਿੱਧੇ ਤੌਰ 'ਤੇ “tokens” ਵਜੋਂ ਅਪਣਾਉਂਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਸਮਾਂ (timing), ਲਹਿਜਾ (tone) ਅਤੇ ਵਿਜ਼ੂਅਲ ਸੰਕੇਤਾਂ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਿਆ ਜਾਂਦਾ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਇੱਕ transcript ਕੈਪਚਰ ਨਹੀਂ ਕਰ ਸਕਦੀ।

ਤਕਨੀਕੀ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ

  • Token window: 1,050,000 tokens – ਕਈ ਘੰਟਿਆਂ ਦੀਆਂ ਮੀਟਿੰਗ ਰਿਕਾਰਡਿੰਗਾਂ ਨੂੰ ਟੁਕੜਿਆਂ ਵਿੱਚ ਵੰਡੇ ਬਿਨਾਂ ਅਪਣਾਉਣ ਲਈ ਕਾਫ਼ੀ ਹੈ।
  • Self-hosting: ਮਾਡਲ ਨੂੰ ਕੰਪਨੀ ਦੇ ਆਪਣੇ ਸਰਵਰਾਂ 'ਤੇ ਤੈਨਾਤ (deploy) ਕਰੋ, ਤਾਂ ਜੋ ਕੱਚਾ (raw) ਮੀਡੀਆ ਕਦੇ ਵੀ ਸੰਸਥਾ ਦੇ ਅੰਦਰੋਂ ਬਾਹਰ ਨਾ ਜਾਵੇ।
  • Pricing: $0.14 ਪ੍ਰਤੀ ਮਿਲੀਅਨ input tokens, $0.28 ਪ੍ਰਤੀ ਮਿਲੀਅਨ output tokens – ਇੱਕ ਪਾਰਦਰਸ਼ੀ ਲਾਗਤ ਜੋ ਵਰਤੋਂ ਦੇ ਅਨੁਸਾਰ ਵਧਦੀ ਹੈ।

ਟੈਕਸਟ-ਸਿਰਫ਼ ਕੋਰ (text-only core) ਦੀ ਇੱਕ ਤੇਜ਼ ਜਾਂਚ ਵਿੱਚ, ਮਾਡਲ ਨੇ ਉਮੀਦ ਕੀਤੇ O(n log n) algorithm ਦੇ ਨਾਲ ਇੱਕ ਕਲਾਸਿਕ merge-interval coding ਸਮੱਸਿਆ ਨੂੰ ਹੱਲ ਕੀਤਾ, ਇੱਕ ਟੈਂਕ-ਫਿਲ ਰੇਟ ਮੈਥ ਸਮੱਸਿਆ ਨੂੰ ਕਦਮ-