MiniMax เพิ่งปล่อย weights สำหรับโมเดลสร้างวิดีโอ H3 บน Hugging Face ทำให้ใครก็ตามที่มี GPU ประสิทธิภาพดีสามารถดาวน์โหลดระบบหลักไปใช้งานได้ การปล่อยครั้งนี้ยังไม่ครอบคลุมถึง pipeline เชิงพาณิชย์แบบเต็มรูปแบบ โดยมีเพียง H3-Base generator เท่านั้นที่เป็นแบบ open-weight ส่วนขั้นตอนการทำ preprocessing และ upscaling ยังคงต้องใช้งานผ่าน API
สิ่งที่มีอยู่จริงในการปล่อยแบบ open-weight ครั้งนี้
สถาปัตยกรรม H3 ของ MiniMax แบ่งออกเป็นสามส่วนหลัก โดยสองส่วนที่ยังคงต้องใช้งานผ่าน API เท่านั้นคือ:
- Context-IR layer – ทำหน้าที่ preprocess ข้อความ รูปภาพ หรือคลิปวิดีโอสั้นๆ ที่เป็น input
- Regenerate-2K layer – เพิ่มความละเอียดของ output ให้เป็นวิดีโอความละเอียดสูง (2K)
นักพัฒนาสามารถดาวน์โหลด H3-Base core generator ซึ่งเป็นเอนจินที่เปลี่ยน multimodal prompts ให้กลายเป็นคลิปวิดีโอที่มีความยาวด้านสั้น 768 พิกเซล พร้อมเสียงในตัว
ข้อเท็จจริงด้านฮาร์ดแวร์และการรันไทม์
โมเดลนี้มีพารามิเตอร์ 33 พันล้านพารามิเตอร์ และมีให้เลือกสองรูปแบบ:
- fl2va – รองรับ text และ image prompts
- ref2va – รองรับวิดีโออ้างอิง (reference video) เป็นส่วนหนึ่งของ prompt
checkpoint แบบ quantized ที่เล็กที่สุดมีขนาดประมาณ 21 GB ส่วน checkpoint แบบ full-precision มีขนาด 123.6 GB โดย MiniMax แนะนำว่าควรมี VRAM หรือพื้นที่จัดเก็บอย่างน้อย 42.5 GB เพื่อการใช้งานที่ราบรื่น
บน GPU ขนาด 12 GB นักพัฒนาสามารถรันโมเดลได้โดยใช้ CPU offloading แต่ความเร็วในการ inference จะช้าลงอย่างเห็นได้ชัด การสร้างวิดีโอแบบ local จะทำความละเอียดได้สูงสุดเพียง 768 px ในด้านที่สั้นที่สุด ซึ่งต่ำกว่าความละเอียด 2K ที่ได้จาก layer Regenerate-2K แบบ proprietary อย่างมาก
ทำไมการปล่อยครั้งนี้ถึงสำคัญ
การจัดอันดับล่าสุดของ Artificial Analysis ให้ H3 อยู่อันดับหนึ่งในหมวด "video editing" และติดอันดับหนึ่งในสามทั้งในหมวด "text-to-video" และ "image-to-video" คะแนนเหล่านี้ทำให้มันเป็นโมเดลวิดีโอแบบ open-weight ที่มีความสามารถสูงที่สุดที่มีอยู่ในปัจจุบัน
โมเดลนี้เป็นแบบ multimodal: สามารถเข้าใจทั้งข้อความ รูปภาพ วิดีโอ และเสียง และสามารถสังเคราะห์วิดีโอพร้อมเสียงที่ตรงกันได้ ซึ่งถือเป็นความสามารถที่กว้างขวางอย่างไม่ธรรมดาสำหรับชุด weights ที่เปิดให้ดาวน์โหลดสาธารณะ
ข้อจำกัดและอีกด้านหนึ่งของเรื่องนี้
H3 ไม่ได้เหนือกว่าในทุกด้าน โดย Gemini Omni Flash ทำผลงานได้ดีกว่าในบางงาน เนื่องจากขั้นตอนการทำ high-resolution upscaling ต้องใช้งานผ่าน API นักพัฒนาจึงไม่สามารถเข้าถึงผลลัพธ์เชิงพาณิชย์แบบเต็มรูปแบบได้หากไม่จ่ายเงินค่าบริการของ MiniMax
เรื่องลิขสิทธิ์เป็นอีกหนึ่งอุปสรรค โดยข้อกำหนดระบุชัดเจนว่าห้ามใช้งานใน สหภาพยุโรป, สหราชอาณาจักร, เกาหลีใต้ และสหรัฐอเมริกา องค์กรในภูมิภาคเหล่านี้จะต้องเจรจาข้อตกลงเชิงพาณิชย์แยกต่างหาก หรือไม่ก็ต้องมองหาตัวเลือกอื่น
สรุป: H3 แบบ open-weight ของ MiniMax มอบเครื่องมือสร้างวิดีโอแบบ multimodal ที่ทรงพลังให้นักพัฒนาสามารถรันได้ในเครื่องของตนเอง แต่การที่ขั้นตอน preprocessing และ upscaling ต้องใช้ผ่าน API เท่านั้น ประกอบกับความต้องการฮาร์ดแวร์ที่สูง และข้อห้ามด้านลิขสิทธิ์ในบางภูมิภาค ทำให้ประสบการณ์การใช้งานเชิงพาณิชย์แบบเต็มรูปแบบยังคงเป็นเรื่องยากสำหรับหลายๆ คน
