Xiaomi ได้เปิดตัว MiMo V2.5 ซึ่งเป็นโมเดลแบบ multimodal แบบ open-weight ที่ประมวลผลเสียง รูปภาพ และวิดีโอในรูปแบบ native tokens และมาพร้อมกับ context window ขนาด 1.05 ล้านโทเคน รายละเอียดราคาแจ้งไว้ที่ $0.14 ต่อหนึ่งล้าน input tokens และ $0.28 ต่อหนึ่งล้าน output tokens ซึ่งโครงสร้างต้นทุนนี้ช่วยให้การรันการประชุมที่มีความยาวมากหรือการสตรีมวิดีโอใน prompt เดียวสามารถทำได้จริง

ทำไม “open-weight” ถึงสำคัญ

AI แบบ multimodal ส่วนใหญ่จะใช้วิธีนำส่วนหน้า (front-ends) ที่แยกจากกันมาประกอบกัน เช่น เครื่องมือแปลงเสียงเป็นข้อความ (speech-to-text), โมเดลบรรยายภาพ (image-captioning) จากนั้นจึงป้อนข้อความที่ได้เข้าสู่ Large Language Model (LLM) ซึ่งทำให้ LLM ไม่เคยเห็นข้อมูลคลื่นเสียงดิบหรือข้อมูลพิกเซลเลย ดังนั้นรายละเอียดที่ละเอียดอ่อน เช่น น้ำเสียง การเว้นจังหวะ หรือท่าทาง จึงอาจสูญหายไป Xiaomi อ้างว่า MiMo V2.5 รับข้อมูลเสียงและวิดีโอโดยตรง ซึ่งช่วยรักษาจังหวะเวลา น้ำเสียง และสัญญาณทางภาพไว้ได้ ในทางทฤษฎี สิ่งนี้ช่วยให้โมเดลสามารถตรวจจับเสียงถอนหายใจในการโทรศัพท์ ติดตามการวาดภาพบนไวท์บอร์ด หรือแยกแยะผู้พูดที่พูดแทรกกันได้โดยไม่ต้องผ่านขั้นตอนการถอดความ (transcription) ระหว่างทาง

เนื่องจากน้ำหนัก (weights) ของโมเดลถูกปล่อยออกมาแบบเปิด องค์กรต่างๆ จึงสามารถดาวน์โหลดและรันแบบ on-premise ได้ ซึ่งช่วยหลีกเลี่ยงแนวทางปฏิบัติทั่วไปที่ต้องส่งสื่อดิบไปยัง Cloud APIs ซึ่งเป็นขั้นตอนที่ภาคส่วนที่มีกฎระเบียบเคร่งครัด เช่น การดูแลสุขภาพและการเงิน มักจะไม่เต็มใจหรือถูกสั่งห้ามไม่ให้ทำ

ข้อมูลทางเทคนิคที่สำคัญ

  • Context window: 1.05 ล้านโทเคน ซึ่งเพียงพอสำหรับบรรจุการประชุมหลายชั่วโมงหรือสารคดีความยาวเต็มเรื่องไว้ในการร้องขอ (request) เพียงครั้งเดียว
  • Pricing: $0.14 ต่อหนึ่งล้าน input tokens, $0.28 ต่อหนึ่งล้าน output tokens
  • Modalities: เสียง, รูปภาพ, วิดีโอ พร้อมกับการจัดการข้อความมาตรฐาน

Context window ขนาดใหญ่คือจุดเด่นที่สุด LLM แบบดั้งเดิมมักจะจำกัดอยู่ที่ไม่กี่พันโทเคน ทำให้เหล่านักพัฒนาต้องแบ่งไฟล์บันทึกเสียงยาวๆ ออกเป็นส่วนๆ หรือตัดวิดีโอเป็นคลิปสั้นๆ แต่ด้วย MiMo V2.5 prompt เดียวสามารถบรรจุการประชุมหลายชั่วโมงได้โดยไม่ต้องตัดแบ่งเป็นส่วนๆ

เจาะลึกการทำงานของเอนจินข้อความ

แม้ว่า pipeline ของเสียงและวิดีโอจะยังไม่มีการทดสอบประสิทธิภาพ (benchmark) อย่างเป็นอิสระ แต่แกนหลักด้านข้อความก็ได้ผ่านการทดสอบความถูกต้องเบื้องต้น (sanity check) ดังนี้:

  • Coding: โมเดลสามารถแก้ปัญหาคลาสสิกอย่าง “merge intervals” และสร้างอัลกอริทึมที่มีความซับซ้อนระดับ O(n log n) ซึ่งแสดงให้เห็นว่าสามารถเข้าใจข้อจำกัดทางอัลกอริทึมได้
  • Reasoning: โมเดลสามารถตอบโจทย์ปัญหาคณิตศาสตร์แบบหลายขั้นตอนด้วยการคำนวณที่ชัดเจนสี่ขั้นตอน แสดงให้เห็นถึงความสามารถในการคิดแบบ chain-of-thought
  • Structured output: เมื่อได้รับคำอธิบายรูปภาพใบแจ้งหนี้ โมเดลสามารถส่งออกวัตถุ JSON ที่จัดรูปแบบอย่างถูกต้อง พร้อมรายการสินค้า ยอดรวม และวันที่

รากฐานด้านข้อความที่แข็งแกร่งนั้นสำคัญ เพราะสถาปัตยกรรม transformer แบบเดียวกันนี้เป็นพื้นฐานให้กับเส้นทางแบบ multimodal หากด้านภาษาทำงานผิดพลาด ความสามารถของโมเดลในการผสานสัญญาณเสียงหรือวิดีโอเข้าด้วยกันก็จะถูกจำกัดลง

กรณีการใช้งานที่เน้นความเป็นส่วนตัวเป็นหลัก

องค์กรที่ต้องเก็บสื่อดิบไว้ภายในองค์กรสามารถจินตนาการถึงการใช้ stack แบบ self-hosted เพียงชุดเดียวสำหรับ:

  • Meeting intelligence: การสรุปการประชุม, การดึงรายการสิ่งที่ต้องทำ (action items), การระบุตัวผู้พูด และการวิเคราะห์ความรู้สึก (sentiment analysis) โดยไม่ต้องส่งไฟล์บันทึกเสียงไปยังบริการของบุคคลที่สาม
  • Call analytics: การตรวจจับความเครียด ความหงุดหงิด หรือคำสำคัญที่เกี่ยวข้องกับการปฏิบัติตามกฎระเบียบ (compliance) แบบเรียลไทม์
  • Voice interfaces: การสร้างแชทบอทที่เข้าใจน้ำเสียงและสามารถตอบโต้ด้วยการเน้นเสียงที่เหมาะสม
  • Video analysis: การจดจำท่าทาง การเปลี่ยนสไลด์ หรือการวาดภาพบนหน้าจอระหว่างการสัมมนาผ่านเว็บ (webinar)

การแทนที่โซลูชันจากผู้ให้บริการสามรายที่แยกกันด้วยโมเดลเพียงโมเดลเดียว ช่วยลดภาระในการรวมระบบ (integration overhead) และลดจุดเสี่ยงที่ข้อมูลจะรั่วไหล

ข้อควรระวังและสิ่งที่ควรตรวจสอบ

ความสามารถด้านเสียงและวิดีโอยังคงเป็นเพียงคำกล่าวอ้างของผู้ผลิต ยังไม่มีการเผยแพร่ผลการวัดผลที่เป็นอิสระ ผู้ที่สนใจนำไปใช้งานควรทำการทดสอบประสิทธิภาพ (benchmark) ด้วยชุดข้อมูลที่เป็นตัวแทนของงานตนเองก่อนที่จะนำไปใช้ในระบบงานจริง (production workloads)

ในส่วนของราคา แม้จะมีความโปร่งใส แต่เป็นการคิดราคาตามจำนวนโทเคน

สิ่งที่ต้องจับตามองต่อไป

  • การเผยแพร่ผล Benchmark: การประเมินจากบุคคลที่สามเกี่ยวกับคุณภาพของการทำ tokenization ของเสียง/วิดีโอ, ความหน่วง (latency) และการใช้หน่วยความจำ (memory footprint)
  • ระบบนิเวศของเครื่องมือ (Tooling ecosystem): ตัวปรับแต่ง (adapters) แบบ open-source สำหรับ audio codecs และ video containers ยอดนิยมที่สามารถป้อนข้อมูลเข้าสู่ MiMo V2.5 ได้โดยตรง
  • การตอบรับจากหน่วยงานกำกับดูแล: หน่วยงานกำกับดูแลด้านความเป็นส่วนตัวของข้อมูลจะมองว่าโมเดลแบบ open-weight ที่รันแบบ self-hosted เป็นมาตรการป้องกันที่เพียงพอเมื่อเทียบกับ Cloud APIs หรือไม่
  • การสนับสนุนจากชุมชน: เนื่องจากน้ำหนักของโมเดลเป็นสาธารณะ ชุมชนอาจทำการ fine-tune โมเดลสำหรับโดเมนเฉพาะทาง (เช่น การจดบันทึกทางการแพทย์, การให้การในชั้นศาล)

MiMo V2.5 ยกระดับการพูดถึงจาก "ตัวเชื่อมประสานมัลติโมดัล" ไปสู่ "สมองมัลติโมดัล" ที่สามารถทำงานอยู่ภายใต้ไฟร์วอลล์ขององค์กรได้ ความเป็น open-weight ช่วยลดอุปสรรคสำหรับองค์กรที่ให้ความสำคัญกับความเป็นส่วนตัว แต่ความคมชัดของเสียงและวิดีโอตามที่กล่าวอ้างนั้นยังคงต้องรอการพิสูจน์ จนกว่าการทดสอบที่เป็นอิสระจะยืนยันข้อกล่าวอ้างดังกล่าว จุดขายที่สำคัญที่สุดของโมเดลนี้ยังคงเป็น context window ที่มีขนาดมหาศาล และความเป็นไปได้ในการรวมบริการ AI หลายอย่างเข้าด้วยกันเป็น stack เดียวที่ติดตั้งและดูแลเอง (self-hosted)