شیائومی مدل MiMo-V2.5 را عرضه کرده است، یک مدل چندوجهی (multimodal) با وزنهای باز که با صدا، تصویر و ویدیو به عنوان توکنهای بومی برخورد میکند. این مدل پنجره بافت ۱,۰۵۰,۰۰۰ توکنی را ارائه میدهد و با قیمت پرداخت به میزان مصرف، شامل ۰.۱۴ دلار به ازای هر میلیون توکن ورودی و ۰.۲۸ دلار به ازای هر میلیون توکن خروجی، سازمانهایی را هدف قرار داده است که به هوش مصنوعی سنگین از نظر رسانهای و در محل (on-premise) نیاز دارند.
چرا یک رویکرد چندوجهی جدید اهمیت دارد
اکثر سیستمهای چندوجهی موجود تقلب میکنند. آنها ابتدا یک موتور تبدیل گفتار به متن را اجرا میکنند، سپس یک مدل بینایی که تصاویر را به شرح (caption) تبدیل میکند و در نهایت متن حاصل را به یک مدل زبانی بزرگ (LLM) میدهند. LLM هرگز موج صوتی اصلی یا دادههای پیکسلی را نمیبیند، بنابراین ظرافتهایی مانند آه کشیدن، مکث، لرزش صورت یا حرکات دست از بین میروند. MiMo-V2.5 این مسیر طولانی را حذف میکند: این مدل صدا و ویدیو را مستقیماً به عنوان «توکن» دریافت میکند و زمانبندی، لحن و نشانههای بصری را که یک متن تایپی نمیتواند ثبت کند، حفظ میکند.
مشخصات فنی
- پنجره توکن: ۱,۰۵۰,۰۰۰ توکن – کافی برای دریافت ضبط جلسات چند ساعته بدون نیاز به تکهتکه کردن آنها.
- میزبانی شخصی (Self-hosting): استقرار مدل روی سرورهای خود شرکت، به طوری که رسانههای خام هرگز از محل خارج نشوند.
- قیمتگذاری: ۰.۱۴ دلار به ازای هر میلیون توکن ورودی، ۰.۲۸ دلار به ازای هر میلیون توکن خروجی – هزینهای شفاف که با میزان استفاده مقیاسپذیر است.
در یک بررسی اولیه سریع هسته متنمحور، این مدل یک مسئله کلاسیک کدنویسی ادغام بازهها (merge-interval) را با الگوریتم مورد انتظار O(n log n) حل کرد، یک مسئله ریاضی نرخ پر شدن مخزن را مرحلهبهمرحله محاسبه کرد و یک محتوای JSON را از یک فاکتور بدون خطا استخراج کرد. خط لولههای صوتی و تصویری در آن تست مورد آزمایش قرار نگرفتند.
چه کسانی سود میبرند
صنایع حساس به حریم خصوصی مانند مراقبتهای بهداشتی و امور مالی نمیتوانند صدا یا ویدیوی خام را به APIهای شخص ثالث ارسال کنند. MiMo-V2.5 با نگه داشتن دادهها پشت دیوار آتش (firewall)، به این سازمانها اجازه میدهد ضمن کسب بینشهای مبتنی بر هوش مصنوعی، با قوانین حفاظت از دادهها نیز مطابقت داشته باشند. کاربردهای بالقوه عبارتند از:
- هوشمندی جلسات: تحلیل کل ضبطهای ویدئویی برای استخراج تصمیمات، موارد اقدام و احساسات گوینده بدون نیاز به مرحله جداگانه تبدیل به متن.
- تحلیلهای مرکز تماس: تشخیص ناامیدی، تردید یا اعتماد به نفس در صدای تماسگیرنده به صورت آنی (real-time).
- دستیارهای دروندستگاهی: ساخت رابطهای صوتی که لحن را درک کرده و به نشانههای غیرکلامی واکنش نشان میدهند، بدون اینکه صدا را به ابر (cloud) ارسال کنند.
موانع عملی
وعده MiMo-V2.5 به عملکرد رمزگذارهای (encoders) صوتی و تصویری آن بستگی دارد – اجزایی که نویسنده هنوز عملکرد آنها را ارزیابی (benchmark) نکرده است. شرکتها باید قبل از تعهد به مرحله تولید، تأخیر (latency)، دقت و مصرف سختافزار را روی مجموعهدادههای خود اعتبارسنجی کنند. تیمهایی که فقط به متن نیاز دارند، احتمالاً مدل کوچکتر و متنمحور را هم از نظر محاسباتی و هم از نظر هزینه کارآمدتر میبینند. ماهیت وزنهای باز MiMo-V2.5 به این معناست که کد و وزنها به صورت عمومی در دسترس هستند؛ این امر امکان سفارشیسازی عمیق را فراهم میکند اما در عین حال مستلزم تخصص داخلی برای نگهداری و ایمنسازی پشته (stack) است.
جمعبندی
MiMo-V2.5 توکنسازی بومی رسانه، پنجره بافت بسیار بزرگ و میزبانی شخصی با هزینه مشخص به ازای هر توکن را ارائه میدهد. برای سازمانهای حساس به حریم خصوصی که باید صدا و ویدیوی خام را در داخل مجموعه نگه دارند، این مدل یک مسیر آزمایشی قابل اتکا فراهم میکند. ارزش واقعی در دنیای واقعی به این بستگی دارد که رمزگذارهای صوتی و تصویری آن چگونه تحت حجم کاری سازمانی عمل میکنند و آیا هزینههای عملیاتی میزبانی شخصی با مهارتهای تیمهای هوش مصنوعی موجود همخوانی دارد یا خیر.
