Xiaomi مدل MiMo V2.5 را عرضه کرده است؛ یک مدل چندوجهی با وزنهای باز (open-weight) که صدا، تصویر و ویدیو را به عنوان توکنهای بومی در نظر میگیرد و پنجره بافت (context window) ۱.۰۵ میلیون توکنی را ارائه میدهد. لیست قیمت، ۱۴ سنت به ازای هر میلیون توکن ورودی و ۲۸ سنت به ازای هر میلیون توکن خروجی را نشان میدهد؛ ساختار هزینهای که اجرای جلسات طولانی یا پخش ویدیوهای استریم را در یک پرامپت واحد امکانپذیر میکند.
چرا «وزنهای باز» (open-weight) اهمیت دارند؟
بیشتر هوشهای مصنوعی چندوجهی، بخشهای مختلف را به هم متصل میکنند: یک موتور تبدیل گفتار به متن، یک مدل شرحنویسی تصویر و سپس تغذیه متن حاصل شده به یک مدل زبانی بزرگ (LLM). در این حالت، LLM هرگز شکل موج خام یا دادههای پیکسل را نمیبیند، بنابراین ظرافتهایی مانند لحن، مکثها یا حرکات بدن ممکن است از دست بروند. Xiaomi ادعا میکند که MiMo V2.5 صدا و ویدیو را مستقیماً دریافت میکند و زمانبندی، آهنگ صدا و نشانههای بصری را حفظ میکند. در تئوری، این قابلیت به مدل اجازه میدهد تا آه کشیدن در یک تماس تلفنی را تشخیص دهد، یک طرح روی تختهسفید را دنبال کند یا گویندگان همپوشان را بدون نیاز به مرحله واسطِ تبدیل به متن، از هم متمایز کند.
از آنجایی که وزنهای مدل به صورت باز منتشر شدهاند، سازمانها میتوانند آن را دانلود کرده و در محل (on-premise) خود اجرا کنند. این کار از روال معمولِ ارسال رسانههای خام به APIهای ابری جلوگیری میکند؛ مرحلهای که بسیاری از بخشهای تحت نظارت — مانند مراقبتهای بهداشتی و امور مالی — در انجام آن تردید دارند یا از آن منع شدهاند.
آمار و ارقام کلیدی فنی
- پنجره بافت (Context window): ۱.۰۵ میلیون توکن، که برای گنجاندن یک جلسه چند ساعته یا یک مستند کامل در یک درخواست کافی است.
- قیمتگذاری: ۰.۱۴ دلار به ازای هر میلیون توکن ورودی، ۰.۲۸ دلار به ازای هر میلیون توکن خروجی.
- مودالیتهها: صدا، تصویر، ویدیو، به همراه مدیریت متن استاندارد.
پنجره بافت بزرگ، نقطه قوت اصلی این مدل است. LLMهای سنتی محدود به چند هزار توکن هستند و توسعهدهندگان را مجبور میکنند ضبطهای طولانی را تکهتکه کنند یا ویدیو را به کلیپهای کوتاه تقسیم نمایند. با MiMo V2.5، یک پرامپت واحد میتواند شامل یک جلسه چند ساعته باشد بدون اینکه نیاز به برش دادن آن به قطعات کوچک باشد.
نگاهی مستقیم به موتور متنی
در حالی که خطوط لوله (pipelines) صوتی و تصویری هنوز به طور مستقل مورد ارزیابی (benchmark) قرار نگرفتهاند، هسته متنی مدل یک بررسی اولیه صحت را با موفقیت پشت سر گذاشت:
- کدنویسی: مدل یک مسئله کلاسیک «ادغام بازهها» (merge intervals) را حل کرد و الگوریتمی با پیچیدگی
O(n log n)ارائه داد که نشان میدهد میتواند محدودیتهای الگوریتمی را درک کند. - استدلال: مدل به یک مسئله ریاضی چندمرحلهای در چهار محاسبه دقیق پاسخ داد که نشاندهنده قابلیت زنجیره تفکر (chain-of-thought) است.
- خروجی ساختاریافته: با دریافت توصیف تصویر یک فاکتور، یک شیء JSON با فرمت صحیح شامل اقلام، مجموعها و تاریخها تولید کرد.
داشتن یک پایه متنی قوی اهمیت زیادی دارد، زیرا همان معماری ترنسفورمر زیربنای مسیرهای چندوجهی است. اگر بخش زبان دچار لغزش شود، توانایی مدل در ترکیب نشانههای صوتی یا تصویری محدود خواهد شد.
موارد استفاده با اولویت حریم خصوصی
شرکتهایی که باید رسانههای خام را در داخل سازمان خود نگه دارند، اکنون میتوانند یک پشته (stack) واحد و میزبانیشده شخصی را برای موارد زیر تصور کنند:
- هوش جلسات: خلاصهسازی، استخراج موارد اقدام، تعیین گوینده و تحلیل احساسات بدون ارسال ضبطها به سرویسهای شخص ثالث.
- تحلیل تماسها: تشخیص استرس، ناامیدی یا کلمات کلیدی مرتبط با انطباق (compliance) به صورت آنی.
- رابطهای صوتی: ساخت چتباتهایی که لحن را درک میکنند و میتوانند با آهنگ صدای مناسب پاسخ دهند.
- تحلیل ویدیو: تشخیص حرکات بدن، تغییر اسلایدها یا طراحیهای روی صفحه در طول وبینارها.
جایگزینی سه راهکار مجزا از فروشندگان مختلف با یک مدل واحد، هزینههای جانبی یکپارچهسازی را کاهش داده و نقاط نشت داده را کم میکند.
هشدارها و موارد قابل بررسی
قابلیتهای صوتی و تصویری فعلاً در حد ادعاهای سازنده هستند؛ هیچ اندازهگیری مستقلی منتشر نشده است. کاربران احتمالی باید پیش از تعهد به بارهای کاری عملیاتی، بنچمارکهای خود را روی مجموعهدادههای معرف اجرا کنند.
قیمتگذاری، با وجود شفاف بودن، بر اساس هر توکن است.
آنچه باید در آینده دنبال کرد
- انتشار بنچمارکها: ارزیابیهای شخص ثالث در مورد کیفیت توکنسازی صدا/ویدیو، تأخیر (latency) و میزان مصرف حافظه.
- اکوسیستم ابزارها: آداپتورهای متنباز برای کدکهای صوتی و کانتینرهای ویدیویی محبوب که مستقیماً با MiMo V2.5 کار میکنند.
- بازخوردهای نظارتی: اینکه آیا نهادهای تنظیمگر حریم خصوصی دادهها، مدلهای وزنبازِ میزبانیشده شخصی را در مقایسه با APIهای ابری، به عنوان یک محافظ کافی میبینند یا خیر.
- مشارکتهای جامعه: از آنجایی که وزنها عمومی هستند، جامعه ممکن است مدل را برای حوزههای تخصصی (مانند دیکته پزشکی یا جلسات استماع حقوقی) بازتنظیم (fine-tune) کند.
MiMo V2.5 بحث را از یک «چسب چندوجهی» به سمت یک «مغز چندوجهی» سوق میدهد که میتواند در پشت دیوار آتش سازمانی اجرا شود. ماهیت وزنباز آن موانع را برای سازمانهای حساس به حریم خصوصی کاهش میدهد، اما دقت صوتی/تصویری وعدهدادهشده هنوز نیازمند اثبات است. تا زمانی که آزمایشهای مستقل ادعاها را تأیید کنند، بزرگترین مزیت این مدل، پنجره بافت عظیم و امکان تجمیع چندین سرویس هوش مصنوعی در یک پشته واحد و خود-میزبانیشده باقی میماند.
