Xiaomi השיקה את MiMo-V2.5, מודל מולטי-מודאלי (multimodal) בעל משקלים פתוחים (open-weight) המתייחס לאודיו, תמונה ווידאו כטוקנים (tokens) טבעיים. הוא מציע חלון הקשר (context window) של 1,050,000 טוקנים ומודל תמחור של "שלם לפי שימוש" (pay-as-you-go) של $0.14 למיליון טוקני קלט ו-$0.28 למיליון טוקני פלט, במטרה לשרת ארגונים הזקוקים לבינה מלאכותית מבוססת מדיה המופעלת מקומית (on-premise).

למה גישה מולטי-מודאלית חדשה היא חשובה

רוב המערכות המולטי-מודאליות הקיימות "מרמות". הן מריצות תחילה מנוע speech-to-text, לאחר מכן מודל ראייה (vision model) שהופך תמונות לכיתובים (captions), ולבסוף מזינות את הטקסט שנוצר לתוך מודל שפה גדול (LLM). ה-LLM לעולם אינו רואה את גל הקול המקורי או את נתוני הפיקסלים, ולכן ניואנסים כמו אנחה, הפסקה, תזוזה פנים או מחווה של יד נעלמים. MiMo-V2.5 מדלג על העקיפה הזו: הוא קולט אודיו ווידאו ישירות כ-"tokens", ובכך שומר על תזמון, טון ורמזים ויזואליים שתיעוד טקסטואלי (transcript) אינו יכול ללכוד.

המעטפת הטכנית

  • חלון טוקנים: 1,050,000 טוקנים – מספיק כדי לקלוט הקלטות פגישות של מספר שעות מבלי לחתוך אותן למקטעים.
  • אירוח עצמי (Self-hosting): פריסת המודל על השרתים של החברה, כך שמדיה גולמית לעולם אינה עוזבת את המתחם.
  • תמחור: $0.14 למיליון טוקני קלט, $0.28 למיליון טוקני פלט – עלות שקופה שגדלה בהתאם לשימוש.

בבדיקת תקינות (sanity check) מהירה של ליבת הטקסט בלבד, המודל פתר בעיית קידוד קלאסית של מיזוג מרווחים (merge-interval) עם אלגוריתם ה-O(n log n) הצפוי, חישב בעיית מתמטיקה של קצב מילוי מיכל שלב אחר שלב, וחילץ JSON payload מתוך חשבונית ללא שגיאה. צינורות העיבוד (pipelines) של האודיו והווידאו לא נבדקו בבדיקה זו.

מי עומד להרוויח

תעשיות עם דגש רב על פרטיות, כמו שירותי בריאות ופיננסים, אינן יכולות לשלוח אודיו או וידאו גולמיים ל-APIs של צד שלישי. על ידי שמירת הנתונים מאחורי חומת האש, MiMo-V2.5 מאפשר לארגונים אלו לעמוד בכללי הגנת הפרטיות ועדיין להפיק תובנות מבוססות AI. יישומים פוטנציאליים כוללים:

  • בינה לפגישות (Meeting intelligence): ניתוח הקלטות וידאו שלמות כדי להציף החלטות, משימות לביצוע (action items) וסנטימנט של הדוברים ללא שלב תמלול נפרד.
  • אנליטיקה של מוקדי שירות: זיהוי תסכול, היסוס או ביטחון בקול המתקשר בזמן אמת.
  • עוזרים על המכשיר (On-device assistants): בניית ממשקי קול המבינים טון ומגיבים לרמזים לא מילוליים מבלי לשלוח אודיו לענן.

המכשולים המעשיים

ההבטחה של MiMo-V2.5 תלויה בביצועים של מקודדי (encoders) האודיו והווידאו שלו – רכיבים שהמחבר טרם ביצע להם benchmarking. ארגונים חייבים לוודא שיהוי (latency), דיוק וצריכת חומרה על גבי מאגרי הנתונים שלהם לפני שהם מתחייבים לייצור (production). צוותים הזקוקים לטקסט בלבד ימצאו ככל הנראה מודל קטן יותר המיועד לטקסט בלבד כיעיל יותר הן מבחינת חישוב והן מבחינת עלות. אופי ה-open-weight של MiMo-V2.5 פירושו שהקוד והמשקלים זמינים לציבור; דבר זה מאפשר התאמה אישית עמוקה אך גם דורש מומחיות פנימית כדי לתחזק ולאבטח את המערכת (the stack).

שורה תחתונה

MiMo-V2.5 מציע טוקניזציה (tokenisation) טבעית של מדיה, חלון הקשר עצום ואירוח עצמי בעלות ברורה לכל טוקן. עבור ארגונים רגישים לפרטיות שחייבים לשמור אודיו ווידאו גולמיים בתוך הארגון, המודל מספק נתיב פיילוט בר ביצוע. הערך בעולם האמיתי יהיה תלוי בביצועי מקודדי האודיו והווידאו תחת עומסי עבודה ארגוניים, ובשאלה האם העומס התפעולי (operational overhead) של אירוח עצמי מתאים למיומנויות הקיימות של צוותי ה-AI.