Xiaomi مدل MiMo V2.5 را عرضه کرده است؛ یک مدل چندوجهی با وزن‌های باز (open-weight) که صدا، تصویر و ویدیو را به عنوان توکن‌های بومی در نظر می‌گیرد و پنجره بافت (context window) ۱.۰۵ میلیون توکنی را ارائه می‌دهد. لیست قیمت، ۱۴ سنت به ازای هر میلیون توکن ورودی و ۲۸ سنت به ازای هر میلیون توکن خروجی را نشان می‌دهد؛ ساختار هزینه‌ای که اجرای جلسات طولانی یا پخش ویدیوهای استریم را در یک پرامپت واحد امکان‌پذیر می‌کند.

چرا «وزن‌های باز» (open-weight) اهمیت دارند؟

بیشتر هوش‌های مصنوعی چندوجهی، بخش‌های مختلف را به هم متصل می‌کنند: یک موتور تبدیل گفتار به متن، یک مدل شرح‌نویسی تصویر و سپس تغذیه متن حاصل شده به یک مدل زبانی بزرگ (LLM). در این حالت، LLM هرگز شکل موج خام یا داده‌های پیکسل را نمی‌بیند، بنابراین ظرافت‌هایی مانند لحن، مکث‌ها یا حرکات بدن ممکن است از دست بروند. Xiaomi ادعا می‌کند که MiMo V2.5 صدا و ویدیو را مستقیماً دریافت می‌کند و زمان‌بندی، آهنگ صدا و نشانه‌های بصری را حفظ می‌کند. در تئوری، این قابلیت به مدل اجازه می‌دهد تا آه کشیدن در یک تماس تلفنی را تشخیص دهد، یک طرح روی تخته‌سفید را دنبال کند یا گویندگان هم‌پوشان را بدون نیاز به مرحله واسطِ تبدیل به متن، از هم متمایز کند.

از آنجایی که وزن‌های مدل به صورت باز منتشر شده‌اند، سازمان‌ها می‌توانند آن را دانلود کرده و در محل (on-premise) خود اجرا کنند. این کار از روال معمولِ ارسال رسانه‌های خام به APIهای ابری جلوگیری می‌کند؛ مرحله‌ای که بسیاری از بخش‌های تحت نظارت — مانند مراقبت‌های بهداشتی و امور مالی — در انجام آن تردید دارند یا از آن منع شده‌اند.

آمار و ارقام کلیدی فنی

  • پنجره بافت (Context window): ۱.۰۵ میلیون توکن، که برای گنجاندن یک جلسه چند ساعته یا یک مستند کامل در یک درخواست کافی است.
  • قیمت‌گذاری: ۰.۱۴ دلار به ازای هر میلیون توکن ورودی، ۰.۲۸ دلار به ازای هر میلیون توکن خروجی.
  • مودالیته‌ها: صدا، تصویر، ویدیو، به همراه مدیریت متن استاندارد.

پنجره بافت بزرگ، نقطه قوت اصلی این مدل است. LLMهای سنتی محدود به چند هزار توکن هستند و توسعه‌دهندگان را مجبور می‌کنند ضبط‌های طولانی را تکه‌تکه کنند یا ویدیو را به کلیپ‌های کوتاه تقسیم نمایند. با MiMo V2.5، یک پرامپت واحد می‌تواند شامل یک جلسه چند ساعته باشد بدون اینکه نیاز به برش دادن آن به قطعات کوچک باشد.

نگاهی مستقیم به موتور متنی

در حالی که خطوط لوله (pipelines) صوتی و تصویری هنوز به طور مستقل مورد ارزیابی (benchmark) قرار نگرفته‌اند، هسته متنی مدل یک بررسی اولیه صحت را با موفقیت پشت سر گذاشت:

  • کدنویسی: مدل یک مسئله کلاسیک «ادغام بازه‌ها» (merge intervals) را حل کرد و الگوریتمی با پیچیدگی O(n log n) ارائه داد که نشان می‌دهد می‌تواند محدودیت‌های الگوریتمی را درک کند.
  • استدلال: مدل به یک مسئله ریاضی چندمرحله‌ای در چهار محاسبه دقیق پاسخ داد که نشان‌دهنده قابلیت زنجیره تفکر (chain-of-thought) است.
  • خروجی ساختاریافته: با دریافت توصیف تصویر یک فاکتور، یک شیء JSON با فرمت صحیح شامل اقلام، مجموع‌ها و تاریخ‌ها تولید کرد.

داشتن یک پایه متنی قوی اهمیت زیادی دارد، زیرا همان معماری ترنسفورمر زیربنای مسیرهای چندوجهی است. اگر بخش زبان دچار لغزش شود، توانایی مدل در ترکیب نشانه‌های صوتی یا تصویری محدود خواهد شد.

موارد استفاده با اولویت حریم خصوصی

شرکت‌هایی که باید رسانه‌های خام را در داخل سازمان خود نگه دارند، اکنون می‌توانند یک پشته (stack) واحد و میزبانی‌شده شخصی را برای موارد زیر تصور کنند:

  • هوش جلسات: خلاصه‌سازی، استخراج موارد اقدام، تعیین گوینده و تحلیل احساسات بدون ارسال ضبط‌ها به سرویس‌های شخص ثالث.
  • تحلیل تماس‌ها: تشخیص استرس، ناامیدی یا کلمات کلیدی مرتبط با انطباق (compliance) به صورت آنی.
  • رابط‌های صوتی: ساخت چت‌بات‌هایی که لحن را درک می‌کنند و می‌توانند با آهنگ صدای مناسب پاسخ دهند.
  • تحلیل ویدیو: تشخیص حرکات بدن، تغییر اسلایدها یا طراحی‌های روی صفحه در طول وبینارها.

جایگزینی سه راهکار مجزا از فروشندگان مختلف با یک مدل واحد، هزینه‌های جانبی یکپارچه‌سازی را کاهش داده و نقاط نشت داده را کم می‌کند.

هشدارها و موارد قابل بررسی

قابلیت‌های صوتی و تصویری فعلاً در حد ادعاهای سازنده هستند؛ هیچ اندازه‌گیری مستقلی منتشر نشده است. کاربران احتمالی باید پیش از تعهد به بارهای کاری عملیاتی، بنچمارک‌های خود را روی مجموعه‌داده‌های معرف اجرا کنند.

قیمت‌گذاری، با وجود شفاف بودن، بر اساس هر توکن است.

آنچه باید در آینده دنبال کرد

  • انتشار بنچمارک‌ها: ارزیابی‌های شخص ثالث در مورد کیفیت توکن‌سازی صدا/ویدیو، تأخیر (latency) و میزان مصرف حافظه.
  • اکوسیستم ابزارها: آداپتورهای متن‌باز برای کدک‌های صوتی و کانتینرهای ویدیویی محبوب که مستقیماً با MiMo V2.5 کار می‌کنند.
  • بازخوردهای نظارتی: اینکه آیا نهادهای تنظیم‌گر حریم خصوصی داده‌ها، مدل‌های وزن‌بازِ میزبانی‌شده شخصی را در مقایسه با APIهای ابری، به عنوان یک محافظ کافی می‌بینند یا خیر.
  • مشارکت‌های جامعه: از آنجایی که وزن‌ها عمومی هستند، جامعه ممکن است مدل را برای حوزه‌های تخصصی (مانند دیکته پزشکی یا جلسات استماع حقوقی) بازتنظیم (fine-tune) کند.

MiMo V2.5 بحث را از یک «چسب چندوجهی» به سمت یک «مغز چندوجهی» سوق می‌دهد که می‌تواند در پشت دیوار آتش سازمانی اجرا شود. ماهیت وزن‌باز آن موانع را برای سازمان‌های حساس به حریم خصوصی کاهش می‌دهد، اما دقت صوتی/تصویری وعده‌داده‌شده هنوز نیازمند اثبات است. تا زمانی که آزمایش‌های مستقل ادعاها را تأیید کنند، بزرگترین مزیت این مدل، پنجره بافت عظیم و امکان تجمیع چندین سرویس هوش مصنوعی در یک پشته واحد و خود-میزبانی‌شده باقی می‌ماند.