ทำไมการจัดอันดับถึงมีความสำคัญ

วิดีโอที่สร้างโดย AI ถูกครอบงำโดยระบบแบบปิด (proprietary systems) ที่ปกปิดค่าน้ำหนัก (weights) มาอย่างยาวนาน ทำให้คนอื่นที่ไม่ใช่บริษัทเจ้าของไม่สามารถเข้าถึงข้อมูลได้ การเปิดเผยค่าน้ำหนักของตนเองทำให้ MiniMax มอบโอกาสให้เหล่านักวิจัยและนักพัฒนาอิสระสามารถเข้าถึงข้อมูลได้เช่นเดียวกับที่โมเดลข้อความแบบโอเพนซอร์สได้รับมานานหลายปี ชัยชนะในการทดสอบประสิทธิภาพ (benchmark) ครั้งนี้แสดงให้เห็นว่าโมเดลที่เปิดให้ใช้งานได้อย่างอิสระสามารถแข่งขันได้ในด้านคุณภาพ ไม่ใช่แค่เรื่องต้นทุนเท่านั้น

เส้นทางสู่การเป็นคู่แข่งแบบ open-weight

H3 ของ MiniMax เป็นส่วนหนึ่งของความพยายามในการพัฒนาวิดีโอเชิงสร้างสรรค์ (generative video) อย่างต่อเนื่อง ซึ่งช่วยปรับปรุงความละเอียด อัตราเฟรมเรต และความสอดคล้อง (coherence) ให้ดีขึ้นเรื่อยๆ ในวันเดียวกับที่ ByteDance เปิดตัว Seedance 2.5 ซึ่งเป็นโมเดลที่สามารถเรนเดอร์คลิปความยาว 30 วินาทีได้ แต่กลับเก็บโค้ดและค่าน้ำหนักไว้ภายใต้กำแพงขององค์กร (corporate firewall) ในทางกลับกัน MiniMax เลือกเส้นทางที่ตรงกันข้าม โดยการเผยแพร่โมเดลที่มีพารามิเตอร์ 3.3 หมื่นล้านพารามิเตอร์ ซึ่งสามารถจัดการทั้งข้อความ รูปภาพ วิดีโอ และเสียงได้ในการประมวลผลเพียงครั้งเดียว (single pass)

ความสามารถของโมเดล

  • Multimodal input – พรอมต์ (prompt) เพียงชุดเดียวอาจประกอบด้วยรูปภาพอ้างอิงสูงสุด 9 รูป คลิปวิดีโอสั้น 3 คลิป และคลิปเสียง 3 คลิป โดยโมเดลจะรวมสัญญาณเหล่านี้เข้าด้วยกันเป็นรูปแบบตัวแทนขั้นกลาง (intermediate representation) ที่มีโครงสร้างก่อนที่จะทำการเรนเดอร์
  • Output length and quality – H3 สร้างวิดีโอที่มีความยาวตั้งแต่ 4 ถึง 15 วินาที โดยแต่ละคลิปจะมีเสียงสเตอริโอที่ซิงค์กันอย่างแม่นยำ
  • Parameter count – ด้วยพารามิเตอร์ 3.3 หมื่นล้านพารามิเตอร์ เครือข่ายนี้มีขนาดเทียบเท่ากับโมเดลแบบปิดชั้นนำ ซึ่งช่วยให้สามารถจับรายละเอียดการเคลื่อนไหวและพื้นผิว (texture) ที่มีความละเอียดสูงได้

ความสามารถเหล่านี้ช่วยแก้ปัญหาที่พบบ่อย นั่นคือการรักษาความต่อเนื่องทางภาพและเสียงในแต่ละเฟรม การอนุญาตให้ใช้ชุดข้อมูลอ้างอิงที่หลากหลายขึ้นช่วยให้ H3 ลดปัญหาภาพกระตุกหรือรอยต่อที่ไม่ต่อเนื่อง (jump-cut artifacts) ที่มักพบในระบบ text-to-video หลายๆ ระบบ

ส่วนประกอบที่ยังถูกปิดไว้

MiniMax ตั้งใจที่จะปิดส่วนประกอบสองอย่างไว้ ได้แก่ โมดูลที่ทำ upsample เป็นความละเอียด 2K และเอนจิน H3-Context-IR ที่แปลงพรอมต์แบบ multimodal ให้เป็นรูปแบบภายใน หากไม่มีตัว upscaler ความละเอียดสูงสุดที่คุณจะได้รับบนเครื่องคอมพิวเตอร์ส่วนตัวคือ 768p นอกจากนี้ ผู้ใช้ยังต้องปฏิบัติตามคู่มือการเขียนพรอมต์ของ MiniMax เพื่อรวบรวมข้อมูลอ้างอิง ซึ่งเป็นขั้นตอนที่อาจมีความซับซ้อนทางเทคนิคสำหรับผู้เริ่มต้น

การรัน H3 บนเครื่องส่วนตัว (locally)

คุณสามารถโหลดโมเดลผ่านอินเทอร์เฟซ ComfyUI ที่ขับเคลื่อนโดยชุมชน ค่าน้ำหนักหลักนั้นฟรี แต่ข้อจำกัดด้านความละเอียดทำให้เหล่านักเล่น (hobbyists) และสตูดิโอขนาดเล็กต้องยอมรับผลลัพธ์ที่มีพิกเซลต่ำลง เว้นแต่จะซื้อตัว upscaler แบบปิดของบริษัท อย่างไรก็ตาม โมเดลนี้รองรับการทำ fine-tuning ด้วยฟุตเทจ ตัวละคร หรือสไตล์ภาพที่กำหนดเอง ซึ่งช่วยให้นักพัฒนามีอิสระในการสร้างสรรค์ที่โมเดลแบบปิดไม่มีให้

ข้อจำกัดด้านลิขสิทธิ์ที่จำกัดโอกาสทางธุรกิจ

ใบอนุญาตของ MiniMax อนุญาตให้ใช้งานเชิงพาณิชย์ได้เฉพาะกับบริษัทที่มีรายได้ต่อปีต่ำกว่า 20 ล้านดอลลาร์เท่านั้น ข้อกำหนดนี้ช่วยปกป้องบริษัทจากองค์กรขนาดใหญ่ที่อาจนำเทคโนโลยีไปสร้างรายได้ในระดับมหาศาลโดยไม่ผ่านบริการของ MiniMax เอง ในขณะที่สตาร์ทอัพและห้องปฏิบัติการวิจัยจะได้รับเงื่อนไขที่ผ่อนปรน ส่วนผู้เล่นรายใหญ่จำเป็นต้องเจรจาข้อตกลงแยกต่างหาก

มุมมองต่าง: ทำไมบางคนอาจยังเลือกใช้โมเดลแบบปิด

  • ความยาวคลิปที่มากกว่า – ระบบของ ByteDance สามารถสร้างวิดีโอความยาว 30 วินาที ซึ่งยาวเป็นสองเท่าของความยาวสูงสุดของ H3

สิ่งที่ต้องจับตามองต่อไป

  • **

บทสรุป

H3 ของ MiniMax พิสูจน์ให้เห็นว่าวิดีโอเจเนอเรเตอร์แบบ open-weight สามารถเอาชนะยักษ์ใหญ่แบบปิดได้ในด้านคุณภาพจากการทดสอบประสิทธิภาพ แต่ด้วยความละเอียดที่จำกัด ส่วนประกอบแบบปิดเพิ่มเติม และใบอนุญาตที่มีการจำกัดรายได้ ทำให้โมเดลนี้ยังคงอยู่ในขอบเขตของนักวิจัย สตาร์ทอัพ และนักเล่นทั่วไป ความยืดหยุ่นแบบ multimodal และอิสระในการทำ fine-tuning ของโมเดลนี้ดึงดูดชุมชนโอเพนซอร์ส ในขณะที่องค์กรขนาดใหญ่อาจยังคงโน้มเอียงไปทางโซลูชันแบบปิด จนกว่าระบบนิเวศแบบเปิดจะสามารถเติมเต็มช่องว่างที่เหลืออยู่ได้