Xiaomi השיקה את MiMo V2.5, מודל מולטי-מודאלי בעל משקולות פתוחות (open-weight) המתייחס לאודיו, תמונות ווידאו כטוקנים טבעיים ומציע חלון הקשר (context window) של 1.05 מיליון טוקנים. דף התמחור מציין $0.14 לכל מיליון טוקני קלט ו-$0.28 לכל מיליון טוקני פלט, מבנה עלויות המאפשר להריץ פגישות ארוכות או סטרימינג של וידאו בתוך פרומפט בודד.

למה "משקולות פתוחות" (open-weight) זה חשוב

רוב הבינה המלאכותית המולטי-מודאלית מחברת יחד ממשקים נפרדים: מנוע speech-to-text, מודל image-captioning, ואז מזינה את הטקסט שנוצר למודל שפה גדול (LLM). ה-LLM לעולם לא רואה את גל הקול הגולמי או את נתוני הפיקסלים, ולכן ניואנסים כמו טון, הפסקות או מחוות עלולים ללכת לאיבוד. Xiaomi טוענת ש-MiMo V2.5 קולט אודיו ווידאו ישירות, ובכך שומר על תזמון, אינטונציה ורמזים ויזואליים. תיאורטית, זה מאפשר למודל לזהות אנחה בשיחת טלפון, לעקוב אחר שרטוט על לוח מחיק, או להבחין בין דוברים חופפים ללא צורך בשלב תמלול ביניים.

מכיוון שמשקולות המודל משוחררות באופן פתוח, ארגונים יכולים להוריד ולהריץ אותו מקומית (on-premise). זה עוקף את הפרקטיקה הנפוצה של שליחת מדיה גולמית ל-APIs בענן, שלב שרבים מהמגזרים המוסדרים — שירותי בריאות ופיננסים — נרתעים ממנו או נאסר עליהם לבצע.

נתונים טכניים מרכזיים

  • חלון הקשר (Context window): 1.05 מיליון טוקנים, מספיק כדי להכיל פגישה של מספר שעות או סרטון תיעודי מלא בבקשה אחת.
  • תמחור: $0.14 לכל מיליון טוקני קלט, $0.28 לכל מיליון טוקני פלט.
  • מודליות (Modalities): אודיו, תמונה, וידאו, בנוסף לטיפול בטקסט סטנדרטי.

חלון ההקשר הגדול הוא הכוכב של המופע. מודלי LLM מסורתיים מוגבלים לכמה אלפי טוקנים, מה שמאלץ מפתחים לחלק הקלטות ארוכות או לפצל וידאו לקליפים קצרים. עם MiMo V2.5, פרומפט בודד יכול להכיל פגישה של מספר שעות מבלי לחתוך אותה לחלקים.

מבט ראשון על מנוע הטקסט

בעוד שתהליכי האודיו והווידאו טרם עברו בדיקות ביצועים (benchmarking) עצמאיות, ליבת הטקסט עברה בדיקת תקינות מהירה:

  • תכנות (Coding): המודל פתר בעיית "merge intervals" קלאסית והפיק אלגוריתם עם סיבוכיות של O(n log n), מה שמראה שהוא יכול להבין אילוצים אלגוריתמיים.
  • הסקה (Reasoning): הוא ענה על בעיה מתמטית מילולית רב-שלבית בארבע חישובים נקיים, מה שמדגים יכולת שרשרת מחשבה (chain-of-thought).
  • פלט מובנה (Structured output): בהינתן תיאור של תמונת חשבונית, הוא הפיק אובייקט JSON בפורמט נכון עם פריטי שורה, סכומים ותאריכים.

בסיס טקסט איתן הוא חשוב מכיוון שאותה ארכיטקטורת טרנספורמר (transformer architecture) מהווה את הבסיס למסלולים המולטי-מודאליים. אם צד השפה נכשל, יכולתו של המודל למזג רמזי אודיו או וידאו תהיה מוגבלת.

מקרי בוחן ממוקדי פרטיות

ארגונים שחייבים לשמור על מדיה גולמית בתוך הארגון יכולים כעת לדמיין מחסנית (stack) אחת המאוחסנת עצמאית עבור:

  • בינה של פגישות (Meeting intelligence): סיכומים, חילוץ משימות לביצוע (action items), ייחוס דוברים וניתוח סנטימנט ללא שליחת הקלטות לשירות צד שלישי.
  • אנליטיקה של שיחות: זיהוי לחץ, תסכול או מילות מפתח הקשורות לציות (compliance) בזמן אמת.
  • ממשקי קול: בניית צ'אטבוטים שמבינים טון ויכולים להגיב באינטונציה קולית מתאימה.
  • ניתוח וידאו: זיהוי מחוות, החלפת שקופיות או רישומים על המסך במהלך וובינרים.

החלפת שלושה פתרונות ספקים נפרדים במודל אחד מקצצת את הוצאות האינטגרציה ומפחיתה נקודות של דליפת נתונים.

סייגים ומה כדאי לוודא

יכולות האודיו והווידאו נותרות טענות של היצרן; לא פורסמו מדידות עצמאיות. מאמצים פוטנציאליים צריכים להריץ בדיקות ביצועים (benchmarks) משלהם על מערכי נתונים מייצגים לפני התחייבות לעומסי עבודה בייצור (production).

התמחור, למרות שהוא שקוף, הוא לפי טוקן.

מה כדאי לעקוב אחריו

  • פרסום תוצאות Benchmark: הערכות צד שלישי לאיכות הטוקניזציה של אודיו/וידאו, שיהוי (latency) וטביעת רגל בזיכרון.
  • מערכת אקולוגית של כלים (Tooling ecosystem): מתאמים בקוד פתוח עבור קידודים (codecs) של אודיו ומכולות וידאו פופולריים שמאכילים ישירות את MiMo V2.5.
  • משוב רגולטורי: האם רגולטורים של פרטיות נתונים רואים במודלים בעלי משקולות פתוחות המאוחסנים עצמאית כהגנה מספקת בהשוואה ל-APIs בענן.
  • תרומות קהילה: מכיוון שהמשקולות ציבוריות, הקהילה עשויה לבצע כוונון עדין (fine-tune) למודל עבור תחומים נישתיים (למשל, תמלול רפואי, עדות משפטית).

MiMo V2.5 pushes the conversation from “multimodal glue” to “multimodal brain” that can run behind a corporate firewall. Its open-weight nature lowers the barrier for privacy-sensitive organisations, but the promised audio/video fidelity still needs proof. Until independent tests confirm the claims, the model’s biggest selling point remains its massive context window and the possibility of consolidating several AI services into a single, self-hosted stack.