أطلقت Xiaomi نموذج MiMo V2.5، وهو نموذج متعدد الوسائط مفتوح الأوزان (open-weight) يعامل الصوت والصور والفيديو كرموز (tokens) أصلية، ويوفر نافذة سياق تبلغ 1.05 مليون رمز. وتوضح قائمة الأسعار أن التكلفة تبلغ 0.14 دولار لكل مليون رمز إدخال و0.28 دولار لكل مليون رمز إخراج، وهو هيكل تكلفة يجعل من الممكن إجراء اجتماعات طويلة أو بث مقاطع فيديو في طلب (prompt) واحد.
لماذا تهم "الأوزان المفتوحة" (open-weight)
تعتمد معظم أنظمة الذكاء الاصطناعي متعددة الوسائط على دمج واجهات أمامية منفصلة: محرك لتحويل الكلام إلى نص، ونموذج لوصف الصور، ثم تغذية النص الناتج في نموذج لغوي كبير (LLM). في هذه الحالة، لا يرى النموذج اللغوي الكبير الموجة الصوتية الخام أو بيانات البكسل، مما قد يؤدي إلى فقدان الفروق الدقيقة مثل النبرة أو التوقفات أو الإيماءات. وتدعي Xiaomi أن MiMo V2.5 يستوعب الصوت والفيديو مباشرة، مما يحافظ على التوقيت والتنغيم والإشارات المرئية. ومن الناحية النظرية، يتيح ذلك للنموذج رصد تنهيدة في مكالمة هاتفية، أو تتبع رسم على سبورة بيضاء، أو التمييز بين المتحدثين المتداخلين دون الحاجة إلى خطوة نسخ وسيطة.
ولأن أوزان النموذج يتم إصدارها علنًا، يمكن للمؤسسات تنزيله وتشغيله محليًا (on-premise). وهذا يتجنب الممارسة الشائعة المتمثلة في إرسال الوسائط الخام إلى واجهات برمجة تطبيقات سحابية (cloud APIs)، وهي خطوة تتردد أو تُمنع منها العديد من القطاعات الخاضعة للتنظيم، مثل الرعاية الصحية والتمويل.
الأرقام التقنية الرئيسية
- نافذة السياق: 1.05 مليون رمز، وهي كافية لاستيعاب اجتماع يمتد لعدة ساعات أو فيلم وثائقي كامل في طلب واحد.
- التسعير: 0.14 دولار لكل مليون رمز إدخال، 0.28 دولار لكل مليون رمز إخراج.
- الوسائط (Modalities): الصوت، الصورة، الفيديو، بالإضافة إلى التعامل القياسي مع النصوص.
تعد نافذة السياق الكبيرة هي الميزة الأبرز؛ فالمتطلبات التقليدية للنماذج اللغوية الكبيرة (LLMs) تقتصر على بضعة آلاف من الرموز، مما يضطر المطورين إلى تقسيم التسجيلات الطويلة أو تقطيع الفيديو إلى مقاطع قصيرة. أما مع MiMo V2.5، فيمكن لطلب واحد أن يحتوي على اجتماع يمتد لعدة ساعات دون الحاجة لتقسيمه.
نظرة مباشرة على محرك النصوص
بينما لم تخضع مسارات معالجة الصوت والفيديو لاختبارات أداء مستقلة، فقد اجتاز جوهر النصوص اختبارًا أوليًا سريعًا:
- البرمجة: حل النموذج مشكلة كلاسيكية لـ "دمج الفترات" (merge intervals) وأنتج خوارزمية بتعقيد
O(n log n)، مما يظهر قدرته على فهم القيود الخوارزمية. - الاستنتاج المنطقي: أجاب على مسألة رياضية لفظية متعددة الخطوات عبر أربع عمليات حسابية دقيقة، مما أظهر قدرة "تسلسل الأفكار" (chain-of-thought).
- المخرجات المهيكلة: عند إعطائه وصفًا لصورة فاتورة، أصدر كائن JSON منسقًا بشكل صحيح يحتوي على بنود الفاتورة، والإجماليات، والتواريخ.
إن وجود أساس نصي قوي أمر بالغ الأهمية لأن بنية المحولات (transformer architecture) نفسها هي التي تدعم المسارات متعددة الوسائط. فإذا تعثر الجانب اللغوي، فستكون قدرة النموذج على دمج الإشارات الصوتية أو المرئية محدودة.
حالات استخدام تركز على الخصوصية
يمكن للمؤسسات التي يجب أن تحتفظ بالوسائط الخام داخل منشآتها الآن تصور مجموعة أدوات واحدة مستضافة ذاتيًا من أجل:
- ذكاء الاجتماعات: التلخيص، واستخراج بنود العمل، وتحديد هوية المتحدث، وتحليل المشاعر دون إرسال التسجيلات إلى خدمة طرف ثالث.
- تحليلات المكالمات: رصد التوتر أو الإحباط أو الكلمات المفتاحية المتعلقة بالامتثال في الوقت الفعلي.
- الواجهات الصوتية: بناء روبوتات محادثة تفهم النبرة ويمكنها الرد بنبرة صوتية مناسبة.
- تحليل الفيديو: التعرف على الإيماءات، أو تغيير الشرائح، أو الرسومات على الشاشة أثناء الندوات عبر الإنترنت (webinars).
إن استبدال ثلاثة حلول من موردين مختلفين بنموذج واحد يقلل من أعباء التكامل ويحد من نقاط تسرب البيانات.
تنبيهات وما يجب التحقق منه
تظل قدرات الصوت والفيديو مجرد ادعاءات من الشركة المصنعة؛ حيث لم تُنشر أي قياسات مستقلة بعد. لذا، يجب على المتبنين المحتملين إجراء اختبارات الأداء الخاصة بهم على مجموعات بيانات تمثيلية قبل الالتزام بأعباء عمل الإنتاج.
التسعير، رغم شفافيته، يعتمد على عدد الرموز (per-token).
ما يجب مراقبته لاحقًا
- إصدارات اختبارات الأداء: تقييمات الطرف الثالث لجودة ترميز الصوت/الفيديو، وزمن الاستجابة (latency)، واستهلاك الذاكرة (memory footprint).
- منظومة الأدوات: توفر أدوات ربط مفتوحة المصدر لبرامج ترميز الصوت وحاويات الفيديو الشائعة التي تغذي MiMo V2.5 مباشرة.
- الملاحظات التنظيمية: ما إذا كان منظمو خصوصية البيانات يرون في النماذج مفتوحة الأوزان المستضافة ذاتيًا ضمانة كافية مقارنة بواجهات برمجة التطبيقات السحابية.
- مساهمات المجتمع: نظرًا لأن الأوزان عامة، فقد يقوم المجتمع بإجراء ضبط دقيق (fine-tune) للنموذج لمجالات متخصصة (مثل الإملاء الطبي، أو الشهادات القانونية).
ينقل MiMo V2.5 النقاش من مفهوم "الرابط متعدد الوسائط" إلى "الدماغ متعدد الوسائط" الذي يمكن تشغيله خلف جدار حماية الشركات. وتعمل طبيعته مفتوحة الأوزان على خفض الحواجز أمام المؤسسات الحساسة تجاه الخصوصية، ولكن دقة الصوت والفيديو الموعودة لا تزال بحاجة إلى إثبات. وإلى أن تؤكد الاختبارات المستقلة هذه الادعاءات، ستظل الميزة البيعية الأكبر للنموذج هي نافذة السياق الضخمة وإمكانية دمج العديد من خدمات الذكاء الاصطناعي في حزمة واحدة مستضافة ذاتياً.
