Xiaomi ได้เปิดตัว MiMo-V2.5 ซึ่งเป็นโมเดลแบบ multimodal ที่เป็น open-weight โดยประมวลผลเสียง รูปภาพ และวิดีโอในรูปแบบ native tokens โมเดลนี้มาพร้อมกับ context window ขนาด 1,050,000 tokens และราคาแบบ pay-as-you-go ที่ 0.14 ดอลลาร์ต่อหนึ่งล้าน input tokens และ 0.28 ดอลลาร์ต่อหนึ่งล้าน output tokens โดยมุ่งเป้าไปที่องค์กรที่ต้องการ AI ที่เน้นการประมวลผลสื่อและสามารถติดตั้งใช้งานภายในองค์กร (on-premise) ได้

ทำไมแนวทาง multimodal แบบใหม่จึงมีความสำคัญ

ระบบ multimodal ส่วนใหญ่ที่มีอยู่ในปัจจุบันมักใช้วิธีทางลัด โดยเริ่มจากการใช้เครื่องมือ speech-to-text จากนั้นใช้ vision model เพื่อเปลี่ยนรูปภาพเป็นคำบรรยาย (captions) และสุดท้ายจึงป้อนข้อความที่ได้เข้าสู่ large language model (LLM) ซึ่งทำให้ LLM ไม่เคยเห็นคลื่นเสียงหรือข้อมูลพิกเซลต้นฉบับเลย ดังนั้นรายละเอียดเล็กน้อยอย่างเสียงถอนหายใจ การหยุดเว้นจังหวะ การขยับใบหน้า หรือท่าทางมือจึงหายไป MiMo-V2.5 ข้ามขั้นตอนที่ซับซ้อนเหล่านั้น โดยการรับข้อมูลเสียงและวิดีโอโดยตรงในรูปแบบ "tokens" ซึ่งช่วยรักษาจังหวะเวลา น้ำเสียง และสัญญาณทางภาพที่การถอดความ (transcript) ไม่สามารถทำได้

ขอบเขตทางเทคนิค

  • Token window: 1,050,000 tokens – เพียงพอสำหรับการประมวลผลการบันทึกการประชุมที่มีความยาวหลายชั่วโมงโดยไม่ต้องแบ่งเป็นส่วนย่อยๆ
  • Self-hosting: สามารถติดตั้งโมเดลบนเซิร์ฟเวอร์ของบริษัทเองได้ เพื่อให้ข้อมูลสื่อต้นฉบับไม่หลุดออกนอกพื้นที่ขององค์กร
  • Pricing: 0.14 ดอลลาร์ต่อหนึ่งล้าน input tokens และ 0.28 ดอลลาร์ต่อหนึ่งล้าน output tokens – ค่าใช้จ่ายที่โปร่งใสและปรับเปลี่ยนตามการใช้งานจริง

จากการทดสอบความถูกต้องเบื้องต้น (sanity check) ของแกนหลักที่เป็นข้อความเพียงอย่างเดียว พบว่าโมเดลสามารถแก้ปัญหาการเขียนโค้ดแบบ merge-interval สุดคลาสสิกด้วยอัลกอริทึม O(n log n) ตามที่คาดหวัง สามารถคำนวณโจทย์คณิตศาสตร์เรื่องอัตราการเติมน้ำในถังแบบทีละขั้นตอน และดึงข้อมูล JSON payload จากใบแจ้งหนี้ได้อย่างถูกต้องโดยไม่มีข้อผิดพลาด ทั้งนี้ ในการทดสอบดังกล่าวยังไม่ได้มีการทดสอบในส่วนของ audio และ video pipelines

ใครคือผู้ที่จะได้รับประโยชน์

อุตสาหกรรมที่ให้ความสำคัญกับความเป็นส่วนตัวสูง เช่น การแพทย์และการเงิน ไม่สามารถส่งข้อมูลเสียงหรือวิดีโอต้นฉบับไปยัง API ของบุคคลที่สามได้ การเก็บข้อมูลไว้ภายใต้ firewall ของตนเองทำให้ MiMo-V2.5 ช่วยให้องค์กรเหล่านี้ปฏิบัติตามกฎระเบียบด้านการคุ้มครองข้อมูล ในขณะที่ยังคงได้รับข้อมูลเชิงลึกจากการขับเคลื่อนด้วย AI โดยแอปพลิเคชันที่มีศักยภาพ ได้แก่:

  • Meeting intelligence: วิเคราะห์วิดีโอการบันทึกการประชุมทั้งหมดเพื่อสรุปการตัดสินใจ รายการสิ่งที่ต้องทำ (action items) และอารมณ์ของผู้พูด โดยไม่ต้องผ่านขั้นตอนการถอดความแยกต่างหาก
  • Call-center analytics: ตรวจจับความหงุดหงิด ความลังเล หรือความมั่นใจในน้ำเสียงของผู้โทรได้แบบเรียลไทม์
  • On-device assistants: สร้างอินเทอร์เฟซด้วยเสียงที่เข้าใจน้ำเสียงและตอบสนองต่อสัญญาณที่ไม่ใช่คำพูด (non-verbal cues) ได้โดยไม่ต้องส่งเสียงไปยังคลาวด์

อุปสรรคในทางปฏิบัติ

ความสำเร็จของ MiMo-V2.5 ขึ้นอยู่กับประสิทธิภาพของ audio และ video encoders ซึ่งเป็นส่วนประกอบที่ผู้เขียนยังไม่ได้ทำการทดสอบเปรียบเทียบ (benchmark) องค์กรต่างๆ จะต้องตรวจสอบความหน่วง (latency) ความแม่นยำ และการใช้ทรัพยากรฮาร์ดแวร์ด้วยชุดข้อมูลของตนเองก่อนที่จะนำไปใช้งานจริงในระดับการผลิต (production) สำหรับทีมที่ต้องการเพียงแค่ข้อความ น่าจะพบว่าโมเดลขนาดเล็กที่เน้นเฉพาะข้อความเป็นโมเดลที่มีประสิทธิภาพมากกว่าทั้งในด้านการประมวลผลและต้นทุน การที่ MiMo-V2.5 เป็น open-weight หมายความว่าโค้ดและน้ำหนัก (weights) ของโมเดลนั้นเปิดเผยต่อสาธารณะ ซึ่งช่วยให้สามารถปรับแต่งได้อย่างลึกซึ้ง แต่ก็ต้องการความเชี่ยวชาญภายในองค์กรเพื่อดูแลรักษาและรักษาความปลอดภัยของระบบ (stack) ด้วยเช่นกัน

บทสรุป

MiMo-V2.5 นำเสนอการทำ media tokenisation แบบ native, context window ขนาดใหญ่ และการติดตั้งใช้งานด้วยตนเอง (self-hosting) ด้วยราคาต่อ token ที่ชัดเจน สำหรับองค์กรที่ให้ความสำคัญกับความเป็นส่วนตัวและต้องเก็บข้อมูลเสียงและวิดีโอต้นฉบับไว้ภายในองค์กร โมเดลนี้ถือเป็นแนวทางเริ่มต้น (pilot path) ที่ใช้งานได้จริง มูลค่าในการใช้งานจริงจะขึ้นอยู่กับว่า audio และ video encoders จะทำงานอย่างไรภายใต้ภาระงานระดับองค์กร และค่าใช้จ่ายในการดำเนินงาน (operational overhead) ของการ self-hosting นั้นสอดคล้องกับทักษะของทีม AI ที่มีอยู่หรือไม่