Alibaba เปิดตัว Wan3.0: นิยามใหม่ของการสร้างวิดีโอด้วย AI แบบ Multimodal

Alibaba ได้เข้าสู่ช่วงเบต้าของ Wan3.0 อย่างเป็นทางการ ซึ่งเป็นโมเดลสร้างวิดีโอตัวใหม่ที่ทรงพลัง สามารถผลิตคลิปคุณภาพสูงที่มีความยาวสูงสุดถึง 30 วินาที ด้วยการขยายความสามารถในการรับข้อมูล (input) ให้ครอบคลุมถึงเอกสารและคำสั่งแบบ multimodal ที่ซับซ้อน ทำให้ Wan3.0 กลายเป็นเครื่องมือที่อเนกประสงค์สำหรับทั้งครีเอเตอร์ นักการตลาด และวิศวกรหุ่นยนต์

เพิ่มความยาวเป็นสองเท่าและขยายการรับข้อมูลแบบ Multimodal

Wan3.0 ถือเป็นการก้าวกระโดดครั้งสำคัญเมื่อเทียบกับรุ่นก่อนหน้าอย่าง Wan2.5 โดยการเพิ่มความยาววิดีโอสูงสุดเป็นสองเท่าเป็น 30 วินาที สิ่งที่ทำให้โมเดลนี้โดดเด่นอย่างแท้จริงคือเอนจินการประมวลผลแบบ multimodal ที่ซับซ้อน ซึ่งแตกต่างจากเครื่องมือ text-to-video แบบดั้งเดิม เพราะ Wan3.0 สามารถประมวลผลข้อความ รูปภาพ วิดีโอ และเสียงได้พร้อมกัน

โมเดลนี้รองรับการสั่งงาน (prompting) ที่มีความซับซ้อนสูง โดยอนุญาตให้ผู้ใช้ใส่รูปภาพได้สูงสุด 10 ภาพ วิดีโอ 5 คลิป และไฟล์เสียง 5 คลิปในการสั่งงานเพียงครั้งเดียว และสิ่งที่น่าประทับใจที่สุดคือ Wan3.0 สามารถรับข้อมูลสื่อที่ไม่ใช่รูปแบบดั้งเดิม เช่น PDF, หน้าเว็บ และงานนำเสนอ PowerPoint ซึ่งช่วยเปลี่ยนเอกสารทางวิชาชีพที่หยุดนิ่งให้กลายเป็นเนื้อหาวิดีโอที่เคลื่อนไหวได้อย่างมีประสิทธิภาพ นอกจากนี้ ระบบยังมีฟีเจอร์อัจฉริยะที่ช่วยแนะนำความยาววิดีโอที่เหมาะสมที่สุดตามคำสั่งเฉพาะของผู้ใช้ด้วย

แก้ไขปัญหาความท้าทายเรื่อง Visual Drift

หนึ่งในอุปสรรคที่แก้ไขได้ยากที่สุดในการสร้างวิดีโอด้วย AI คือ "visual drift" หรือแนวโน้มที่ตัวละคร ลักษณะใบหน้า และการจัดวางพื้นที่ในภาพจะบิดเบี้ยวหรือเปลี่ยนแปลงไปอย่างไม่เป็นธรรมชาติเมื่อเวลาผ่านไป Alibaba จึงได้ออกแบบ Wan3.0 มาเพื่อต่อสู้กับความไม่สอดคล้องกันเหล่านี้โดยเฉพาะ

ด้วยการให้ความสำคัญกับการรักษาความละเอียดจากวัสดุอ้างอิง โมเดลจึงสามารถรักษาความสมจริง (fidelity) ของตัวละคร อุปกรณ์ประกอบฉาก และอินเทอร์เฟซผู้ใช้ที่ซับซ้อนได้สูงขึ้นมาก การมุ่งเน้นไปที่ความสอดคล้องทางเวลา (temporal consistency) นี้ ทำให้โมเดลมีความเหมาะสมอย่างยิ่งสำหรับเวิร์กโฟลว์ระดับมืออาชีพที่ภาพลักษณ์ของแบรนด์และความต่อเนื่องของตัวละครเป็นสิ่งสำคัญที่ไม่อาจยอมรับความผิดพลาดได้

ราคาที่ปรับเปลี่ยนได้ตามการใช้งานและการประยุกต์ใช้ในอุตสาหกรรม

สามารถเข้าถึง Wan3.0 ได้ผ่านเว็บไซต์ wan.video, Alibaba Cloud Model Studio หรือผ่าน API บน Qwen Cloud โดย Alibaba มีการแบ่งระดับการใช้งานออกเป็นสองระดับ ได้แก่ เวอร์ชัน Standard (ปัจจุบันกำลังลดราคา 30%) และเวอร์ชัน Prime ที่มีความเร็วสูง ราคาจะปรับตามความละเอียด ตั้งแต่ 1.50 ดอลลาร์สำหรับคลิป 480p ความยาว 30 วินาทีในระดับ Standard ไปจนถึง 8.40 ดอลลาร์สำหรับคลิป 1080p ในระดับ Prime

กลยุทธ์การใช้งานมุ่งเป้าไปที่สามภาคส่วนหลัก ได้แก่:

  • ความบันเทิง: เร่งกระบวนการผลิตภาพยนตร์ และสร้างละครสั้นหรือคลิปสำหรับโซเชียลมีเดีย
  • องค์กร: เปลี่ยนข้อความการตลาดและคู่มือการฝึกอบรมให้เป็นสื่อวิดีโอที่น่าดึงดูด
  • เทคโนโลยีขั้นสูง (Deep Tech): ให้ฟุตเทจการจำลองที่สมจริงเพื่อใช้ฝึกฝนยานยนต์ไร้คนขับและระบบหุ่นยนต์

การเปิดตัวครั้งนี้เกิดขึ้นหลังจากการอัดฉีดเงินทุนมหาศาลโดย Alibaba ซึ่งเพิ่งดำเนินการขายหุ้นครั้งใหญ่เพื่อระดมทุนสำหรับการขยายตัวด้าน AI อย่างรวดเร็ว แม้ว่าต้นทุนการลงทุนที่สูงจะส่งผลกระทบต่อกำไรรายไตรมาสก็ตาม

สรุปประเด็นสำคัญ

  • Multimodality ที่เหนือกว่า: Wan3.0 สามารถเปลี่ยน PDF, PowerPoint และหน้าเว็บให้เป็นวิดีโอ โดยรองรับคำสั่งที่ซับซ้อนด้วยสื่อผสมรวมกันสูงสุดถึง 20 รายการ
  • ความสอดคล้องที่ดียิ่งขึ้น: โมเดลนี้จัดการกับปัญหา visual drift โดยเฉพาะ เพื่อให้มั่นใจว่าตัวละคร อุปกรณ์ประกอบฉาก และสภาพแวดล้อมจะมีความเสถียรมากขึ้นตลอดความยาว 30 วินาที
  • การใช้งานที่หลากหลาย: ออกแบบมาสำหรับผู้ใช้ทุกกลุ่ม ตั้งแต่ครีเอเตอร์ที่ต้องการคลิปโซเชียลมีเดีย ไปจนถึงวิศวกรที่ต้องการข้อมูลการจำลองสำหรับการฝึกฝนหุ่นยนต์