أطلقت Xiaomi نموذج MiMo-V2.5، وهو نموذج متعدد الوسائط مفتوح الأوزان (open-weight) يعامل الصوت والصورة والفيديو كرموز (tokens) أصلية. يوفر النموذج نافذة سياق تبلغ 1,050,000 رمز، وبنظام الدفع حسب الاستخدام بسعر 0.14 دولار لكل مليون رمز إدخال و0.28 دولار لكل مليون رمز إخراج، مستهدفاً المؤسسات التي تحتاج إلى ذكاء اصطناعي محلي (on-premise) يعتمد بكثافة على الوسائط.
لماذا يهم اتباع نهج جديد متعدد الوسائط
معظم الأنظمة متعددة الوسائط الحالية تتبع طرقاً غير مباشرة؛ فهي تقوم أولاً بتشغيل محرك لتحويل الكلام إلى نص، ثم نموذج رؤية يحول الصور إلى تعليقات نصية، وأخيراً تغذية النص الناتج في نموذج لغوي كبير (LLM). لا يرى الـ LLM أبداً الموجة الصوتية الأصلية أو بيانات البكسل، لذا تختفي الفروق الدقيقة مثل التنهد، أو التوقف، أو ارتعاش الوجه، أو إيماءة اليد. يتجاوز MiMo-V2.5 هذا المسار الطويل: فهو يستوعب الصوت والفيديو مباشرة كـ "رموز" (tokens)، مما يحافظ على التوقيت والنبرة والإشارات المرئية التي لا يمكن للنص المكتوب التقاطها.
الإطار التقني
- نافذة الرموز (Token window): 1,050,000 رمز – وهو ما يكفي لاستيعاب تسجيلات اجتماعات تمتد لعدة ساعات دون الحاجة لتقسيمها إلى أجزاء.
- الاستضافة الذاتية (Self-hosting): نشر النموذج على خوادم الشركة الخاصة، بحيث لا تخرج الوسائط الخام أبداً من مقر العمل.
- التسعير: 0.14 دولار لكل مليون رمز إدخال، و0.28 دولار لكل مليون رمز إخراج – تكلفة شفافة تتناسب مع حجم الاستخدام.
في اختبار سريع للقدرات الأساسية للنص فقط، حل النموذج مشكلة برمجية كلاسيكية لدمج الفترات (merge-interval) باستخدام خوارزمية O(n log n) المتوقعة، وحسب مسألة رياضية حول معدل ملء خزان خطوة بخطوة، واستخرج حمولة JSON من فاتورة دون خطأ. لم يتم اختبار مسارات الصوت والفيديو في ذلك الاختبار.
من المستفيد؟
لا تستطيع الصناعات التي تولي أهمية قصوى للخصوصية، مثل الرعاية الصحية والتمويل، إرسال ملفات صوتية أو فيديو خام إلى واجهات برمجة تطبيقات (APIs) تابعة لجهات خارجية. ومن خلال إبقاء البيانات خلف جدار الحماية، يتيح MiMo-V2.5 لهذه المؤسسات الامتثال لقواعد حماية البيانات مع الاستمرار في الحصول على رؤى مدفوعة بالذكاء الاصطناعي. تشمل التطبيقات المحتملة ما يلي:
- ذكاء الاجتماعات: تحليل تسجيلات الفيديو الكاملة لاستخراج القرارات، وبنود العمل، ومشاعر المتحدث دون الحاجة لمرحلة تفريغ نصي منفصلة.
- تحليلات مراكز الاتصال: اكتشاف الإحباط أو التردد أو الثقة في صوت المتصل في الوقت الفعلي.
- المساعدون على الأجهزة: بناء واجهات صوتية تفهم النبرة وتتفاعل مع الإشارات غير اللفظية دون إرسال الصوت إلى السحابة.
العقبات العملية
يعتمد وعد MiMo-V2.5 على أداء مشفرات الصوت والفيديو الخاصة به – وهي مكونات لم يقم المؤلف باختبار أدائها بعد. يجب على الشركات التحقق من زمن الاستجابة (latency)، والدقة، واستهلاك الأجهزة على مجموعات البيانات الخاصة بها قبل الالتزام بالإنتاج الفعلي. ومن المرجح أن تجد الفرق التي تحتاج إلى النصوص فقط نموذجاً أصغر مخصصاً للنصوص فقط أكثر كفاءة من حيث الحوسبة والتكلفة. وتعني طبيعة MiMo-V2.5 مفتوحة الأوزان أن الكود والأوزان متاحة للجمهور؛ مما يتيح تخصيصاً عميقاً ولكنه يتطلب أيضاً خبرة داخلية لصيانة وتأمين البنية التقنية.
الخلاصة
يوفر MiMo-V2.5 ترميزاً أصلياً للوسائط (native media tokenisation)، ونافذة سياق ضخمة، واستضافة ذاتية بتكلفة واضحة لكل رمز. بالنسبة للمؤسسات الحساسة للخصوصية التي يجب أن تحتفظ بالصوت والفيديو الخام داخلياً، فإنه يوفر مساراً تجريبياً قابلاً للتطبيق. ستعتمد القيمة في العالم الحقيقي على كيفية أداء مشفرات الصوت والفيديو الخاصة به تحت أعباء عمل الشركات، وما إذا كانت التكاليف التشغيلية للاستضافة الذاتية تتناسب مع مهارات فرق الذكاء الاصطناعي الحالية.
