Xiaomi MiMo V2.5 উন্মোচন করেছে, যা একটি open-weight মাল্টিমোডাল মডেল যা অডিও, ছবি এবং ভিডিওকে নেটিভ টোকেন হিসেবে বিবেচনা করে এবং ১.০৫-মিলিয়ন-টোকেন কনটেক্সট উইন্ডো প্রদান করে। এর মূল্য তালিকা অনুযায়ী প্রতি মিলিয়ন ইনপুট টোকেনের জন্য $০.১৪ এবং প্রতি মিলিয়ন আউটপুট টোকেনের জন্য $০.২৮; এমন একটি খরচ কাঠামো যা একটি মাত্র প্রম্পটে দীর্ঘ মিটিং বা ভিডিও স্ট্রিম চালানোকে সাশ্রয়ী করে তোলে।

কেন “open-weight” গুরুত্বপূর্ণ

বেশিরভাগ মাল্টিমোডাল AI আলাদা আলাদা ফ্রন্ট-এন্ড যুক্ত করে কাজ করে: যেমন একটি speech-to-text ইঞ্জিন, একটি image-captioning মডেল, এবং তারপর প্রাপ্ত টেক্সটটিকে একটি large language model (LLM)-এ ইনপুট হিসেবে দেয়। LLM কখনোই র (raw) ওয়েভফর্ম বা পিক্সেল ডেটা দেখতে পায় না, ফলে কণ্ঠস্বরের ভঙ্গি (tone), বিরতি বা অঙ্গভঙ্গির মতো সূক্ষ্ম বিষয়গুলো হারিয়ে যেতে পারে। Xiaomi দাবি করেছে যে MiMo V2.5 সরাসরি অডিও এবং ভিডিও গ্রহণ করে, যা টাইমিং, স্বরভঙ্গি (intonation) এবং ভিজ্যুয়াল সংকেতগুলো বজায় রাখে। তাত্ত্বিকভাবে, এটি মডেলটিকে কোনো ফোন কলে দীর্ঘশ্বাস শনাক্ত করতে, হোয়াইটবোর্ডে করা কোনো স্কেচ অনুসরণ করতে বা কোনো মধ্যবর্তী ট্রান্সক্রিপশন ধাপ ছাড়াই একাধিক বক্তার কণ্ঠ আলাদা করতে সাহায্য করে।

যেহেতু মডেলটির ওয়েটস (weights) উন্মুক্তভাবে প্রকাশ করা হয়েছে, তাই সংস্থাগুলো এটি ডাউনলোড করে অন-প্রিমিস (on-premise) চালাতে পারে। এটি ক্লাউড API-তে র মিডিয়া পাঠানোর সাধারণ পদ্ধতিটি এড়িয়ে যেতে সাহায্য করে, যা স্বাস্থ্যসেবা এবং ফিন্যান্সের মতো অনেক নিয়ন্ত্রিত খাত করতে অনিচ্ছুক বা নিষিদ্ধ।

প্রযুক্তিগত প্রধান পরিসংখ্যান

  • কনটেক্সট উইন্ডো: ১.০৫ মিলিয়ন টোকেন, যা একটি মাত্র রিকোয়েস্টে কয়েক ঘণ্টার মিটিং বা একটি পূর্ণদৈর্ঘ্য ডকুমেন্টারি রাখার জন্য যথেষ্ট।
  • মূল্য: প্রতি মিলিয়ন ইনপুট টোকেনের জন্য $০.১৪, প্রতি মিলিয়ন আউটপুট টোকেনের জন্য $০.২৮।
  • মোডালিটি: অডিও, ছবি, ভিডিও, এবং সাধারণ টেক্সট হ্যান্ডলিং।

বিশাল কনটেক্সট উইন্ডোটিই এখানে মূল আকর্ষণ। প্রথাগত LLM-গুলো কয়েক হাজার টোকেনের মধ্যে সীমাবদ্ধ থাকে, যার ফলে ডেভেলপারদের দীর্ঘ রেকর্ডিংগুলোকে ছোট ছোট অংশে ভাগ করতে হয় বা ভিডিওকে ছোট ক্লিপে বিভক্ত করতে হয়। MiMo V2.5-এর মাধ্যমে, একটি দীর্ঘ মিটিংকে টুকরো না করেই একটি মাত্র প্রম্পটে রাখা সম্ভব।

টেক্সট ইঞ্জিন সম্পর্কে সরাসরি ধারণা

যদিও অডিও এবং ভিডিও পাইপলাইনগুলো স্বতন্ত্রভাবে বেঞ্চমার্ক করা হয়নি, তবে এর টেক্সট কোর একটি দ্রুত যাচাইকরণে (sanity check) উত্তীর্ণ হয়েছে:

  • কোডিং: মডেলটি একটি ক্লাসিক “merge intervals” সমস্যার সমাধান করেছে এবং O(n log n) জটিলতার একটি অ্যালগরিদম তৈরি করেছে, যা প্রমাণ করে যে এটি অ্যালগরিদমিক সীমাবদ্ধতা বুঝতে সক্ষম।
  • রিজনিং: এটি চারটি নির্ভুল গণনার মাধ্যমে একটি বহু-ধাপের গণিত বিষয়ক সমস্যার সমাধান করেছে, যা এর chain-of-thought সক্ষমতা প্রদর্শন করে।
  • স্ট্রাকচার্ড আউটপুট: একটি ইনভয়েস ইমেজের বর্ণনা দেওয়া হলে, এটি লাইন আইটেম, টোটাল এবং তারিখসহ একটি সঠিকভাবে ফরম্যাট করা JSON অবজেক্ট প্রদান করেছে।

একটি শক্তিশালী টেক্সট ভিত্তি গুরুত্বপূর্ণ কারণ একই ট্রান্সফরমার আর্কিটেকচার মাল্টিমোডাল পথগুলোর ভিত্তি হিসেবে কাজ করে। যদি ভাষার দিকটি দুর্বল হয়, তবে অডিও বা ভিডিও সংকেতগুলোকে একত্রিত করার ক্ষেত্রে মডেলটির সক্ষমতা সীমিত হয়ে পড়বে।

গোপনীয়তা-কেন্দ্রিক ব্যবহারের ক্ষেত্রসমূহ

যেসব প্রতিষ্ঠানকে তাদের র মিডিয়া নিজেদের কাছেই রাখতে হয়, তারা এখন নিচের কাজগুলোর জন্য একটি একক, সেলফ-হোস্টেড স্ট্যাক কল্পনা করতে পারে:

  • মিটিং ইন্টেলিজেন্স: থার্ড-পার্টি সার্ভিসে রেকর্ডিং না পাঠিয়েই সামারি তৈরি, অ্যাকশন-আইটেম নিষ্কাশন, বক্তার পরিচয় শনাক্তকরণ এবং সেন্টিমেন্ট অ্যানালাইসিস।
  • কল অ্যানালিটিক্স: রিয়েল-টাইমে মানসিক চাপ, হতাশা বা কমপ্লায়েন্স-সংক্রান্ত কিওয়ার্ড শনাক্ত করা।
  • ভয়েস ইন্টারফেস: এমন চ্যাটবট তৈরি করা যা কণ্ঠস্বরের ভঙ্গি বুঝতে পারে এবং যথাযথ স্বরে প্রতিক্রিয়া জানাতে পারে।
  • ভিডিও অ্যানালাইসিস: ওয়েবিনারের সময় অঙ্গভঙ্গি, স্লাইড পরিবর্তন বা অন-স্ক্রিন ড্রয়িং শনাক্ত করা।

তিনটি আলাদা ভেন্ডর সলিউশনের পরিবর্তে একটি মডেল ব্যবহার করলে ইন্টিগ্রেশন খরচ কমে এবং ডেটা-লিকেজের ঝুঁকি হ্রাস পায়।

সতর্কতা এবং যা যাচাই করা প্রয়োজন

অডিও এবং ভিডিও সক্ষমতাগুলো এখনও প্রস্তুতকারকের দাবি হিসেবেই রয়েছে; কোনো স্বতন্ত্র পরিমাপ প্রকাশিত হয়নি। সম্ভাব্য ব্যবহারকারীদের প্রোডাকশন কাজের জন্য এটি ব্যবহারের আগে প্রতিনিধি ডেটাসেটের ওপর নিজস্ব বেঞ্চমার্ক চালানো উচিত।

মূল্য ব্যবস্থা স্বচ্ছ হলেও এটি প্রতি-টোকেন হিসেবে নির্ধারিত।

পরবর্তী পর্যবেক্ষণযোগ্য বিষয়সমূহ

  • বেঞ্চমার্ক প্রকাশ: অডিও/ভিডিও টোকেনাইজেশন কোয়ালিটি, ল্যাটেন্সি এবং মেমরি ফুটপ্রিন্টের ওপর তৃতীয় পক্ষের মূল্যায়ন।
  • টুলিং ইকোসিস্টেম: জনপ্রিয় অডিও কোডেক এবং ভিডিও কন্টেইনারের জন্য ওপেন-সোর্স অ্যাডাপ্টার যা সরাসরি MiMo V2.5-এ ইনপুট হিসেবে কাজ করবে।
  • নিয়ন্ত্রক সংস্থার প্রতিক্রিয়া: ডেটা-প্রাইভেসি নিয়ন্ত্রক সংস্থাগুলো ক্লাউড API-এর তুলনায় সেলফ-হোস্টেড open-weight মডেলগুলোকে পর্যাপ্ত সুরক্ষা হিসেবে গণ্য করে কি না।
  • কমিউনিটির অবদান: যেহেতু ওয়েটসগুলো পাবলিক, তাই কমিউনিটি নির্দিষ্ট ডোমেইনের (যেমন: মেডিকেল ডিকটেশন, লিগ্যাল ডিপোজিশন) জন্য মডেলটিকে ফাইন-টিউন করতে পারে।

MiMo V2.5 আলোচনাকে "multimodal glue" থেকে "multimodal brain"-এ নিয়ে যাচ্ছে, যা একটি কর্পোরেট ফায়ারওয়ালের পেছনে চালানো সম্ভব। এর ওপেন-ওয়েট প্রকৃতি গোপনীয়তা-সংবেদনশীল সংস্থাগুলোর জন্য বাধা কমিয়ে দেয়, তবে প্রতিশ্রুতি দেওয়া অডিও/ভিডিও ফিডেলিটি এখনও প্রমাণের অপেক্ষায় রয়েছে। স্বতন্ত্র পরীক্ষাগুলো এই দাবিগুলো নিশ্চিত না করা পর্যন্ত, মডেলটির সবচেয়ে বড় আকর্ষণ হিসেবে থাকছে এর বিশাল কনটেক্সট উইন্ডো এবং বেশ কিছু AI সার্ভিসকে একটি একক, সেলফ-হোস্টেড স্ট্যাকে একত্রিত করার সম্ভাবনা।