شیائومی مدل MiMo-V2.5 را عرضه کرده است، یک مدل چندوجهی (multimodal) با وزن‌های باز که با صدا، تصویر و ویدیو به عنوان توکن‌های بومی برخورد می‌کند. این مدل پنجره بافت ۱,۰۵۰,۰۰۰ توکنی را ارائه می‌دهد و با قیمت پرداخت به میزان مصرف، شامل ۰.۱۴ دلار به ازای هر میلیون توکن ورودی و ۰.۲۸ دلار به ازای هر میلیون توکن خروجی، سازمان‌هایی را هدف قرار داده است که به هوش مصنوعی سنگین از نظر رسانه‌ای و در محل (on-premise) نیاز دارند.

چرا یک رویکرد چندوجهی جدید اهمیت دارد

اکثر سیستم‌های چندوجهی موجود تقلب می‌کنند. آن‌ها ابتدا یک موتور تبدیل گفتار به متن را اجرا می‌کنند، سپس یک مدل بینایی که تصاویر را به شرح (caption) تبدیل می‌کند و در نهایت متن حاصل را به یک مدل زبانی بزرگ (LLM) می‌دهند. LLM هرگز موج صوتی اصلی یا داده‌های پیکسلی را نمی‌بیند، بنابراین ظرافت‌هایی مانند آه کشیدن، مکث، لرزش صورت یا حرکات دست از بین می‌روند. MiMo-V2.5 این مسیر طولانی را حذف می‌کند: این مدل صدا و ویدیو را مستقیماً به عنوان «توکن» دریافت می‌کند و زمان‌بندی، لحن و نشانه‌های بصری را که یک متن تایپی نمی‌تواند ثبت کند، حفظ می‌کند.

مشخصات فنی

  • پنجره توکن: ۱,۰۵۰,۰۰۰ توکن – کافی برای دریافت ضبط جلسات چند ساعته بدون نیاز به تکه‌تکه کردن آن‌ها.
  • میزبانی شخصی (Self-hosting): استقرار مدل روی سرورهای خود شرکت، به طوری که رسانه‌های خام هرگز از محل خارج نشوند.
  • قیمت‌گذاری: ۰.۱۴ دلار به ازای هر میلیون توکن ورودی، ۰.۲۸ دلار به ازای هر میلیون توکن خروجی – هزینه‌ای شفاف که با میزان استفاده مقیاس‌پذیر است.

در یک بررسی اولیه سریع هسته متن‌محور، این مدل یک مسئله کلاسیک کدنویسی ادغام بازه‌ها (merge-interval) را با الگوریتم مورد انتظار O(n log n) حل کرد، یک مسئله ریاضی نرخ پر شدن مخزن را مرحله‌به‌مرحله محاسبه کرد و یک محتوای JSON را از یک فاکتور بدون خطا استخراج کرد. خط لوله‌های صوتی و تصویری در آن تست مورد آزمایش قرار نگرفتند.

چه کسانی سود می‌برند

صنایع حساس به حریم خصوصی مانند مراقبت‌های بهداشتی و امور مالی نمی‌توانند صدا یا ویدیوی خام را به APIهای شخص ثالث ارسال کنند. MiMo-V2.5 با نگه داشتن داده‌ها پشت دیوار آتش (firewall)، به این سازمان‌ها اجازه می‌دهد ضمن کسب بینش‌های مبتنی بر هوش مصنوعی، با قوانین حفاظت از داده‌ها نیز مطابقت داشته باشند. کاربردهای بالقوه عبارتند از:

  • هوشمندی جلسات: تحلیل کل ضبط‌های ویدئویی برای استخراج تصمیمات، موارد اقدام و احساسات گوینده بدون نیاز به مرحله جداگانه تبدیل به متن.
  • تحلیل‌های مرکز تماس: تشخیص ناامیدی، تردید یا اعتماد به نفس در صدای تماس‌گیرنده به صورت آنی (real-time).
  • دستیارهای درون‌دستگاهی: ساخت رابط‌های صوتی که لحن را درک کرده و به نشانه‌های غیرکلامی واکنش نشان می‌دهند، بدون اینکه صدا را به ابر (cloud) ارسال کنند.

موانع عملی

وعده MiMo-V2.5 به عملکرد رمزگذارهای (encoders) صوتی و تصویری آن بستگی دارد – اجزایی که نویسنده هنوز عملکرد آن‌ها را ارزیابی (benchmark) نکرده است. شرکت‌ها باید قبل از تعهد به مرحله تولید، تأخیر (latency)، دقت و مصرف سخت‌افزار را روی مجموعه‌داده‌های خود اعتبارسنجی کنند. تیم‌هایی که فقط به متن نیاز دارند، احتمالاً مدل کوچک‌تر و متن‌محور را هم از نظر محاسباتی و هم از نظر هزینه کارآمدتر می‌بینند. ماهیت وزن‌های باز MiMo-V2.5 به این معناست که کد و وزن‌ها به صورت عمومی در دسترس هستند؛ این امر امکان سفارشی‌سازی عمیق را فراهم می‌کند اما در عین حال مستلزم تخصص داخلی برای نگهداری و ایمن‌سازی پشته (stack) است.

جمع‌بندی

MiMo-V2.5 توکن‌سازی بومی رسانه، پنجره بافت بسیار بزرگ و میزبانی شخصی با هزینه مشخص به ازای هر توکن را ارائه می‌دهد. برای سازمان‌های حساس به حریم خصوصی که باید صدا و ویدیوی خام را در داخل مجموعه نگه دارند، این مدل یک مسیر آزمایشی قابل اتکا فراهم می‌کند. ارزش واقعی در دنیای واقعی به این بستگی دارد که رمزگذارهای صوتی و تصویری آن چگونه تحت حجم کاری سازمانی عمل می‌کنند و آیا هزینه‌های عملیاتی میزبانی شخصی با مهارت‌های تیم‌های هوش مصنوعی موجود همخوانی دارد یا خیر.