Google Vids เปิดตัว Custom AI Avatars และการผสานรวม Gemini Omni
Google กำลังเปลี่ยนเครื่องมือช่วยทำงานด้วย AI ให้กลายเป็นขุมพลังสำหรับการผลิตวิดีโอส่วนบุคคล ด้วยการอัปเดตล่าสุดของ Google Vids ผู้ใช้สามารถสร้าง digital avatar แบบกำหนดเองที่เลียนแบบรูปลักษณ์และเสียงของตนเองได้ ซึ่งถือเป็นการส่งสัญญาณถึงการเปลี่ยนแปลงครั้งสำคัญในวิธีที่ธุรกิจใช้ในการสื่อสารผ่านวิดีโอ
Digital Avatars ส่วนบุคคลเข้าสู่พื้นที่การทำงาน
ด้วยความเคลื่อนไหวที่มุ่งเป้าไปที่ตลาดการสร้างวิดีโอมืออาชีพโดยตรง ขณะนี้ Google Vids อนุญาตให้ผู้ใช้เป็น "ดารา" ในเนื้อหาของตนเองได้ เพียงแค่อัปโหลดรูปเซลฟี่หนึ่งรูปและบันทึกเสียง ผู้ใช้ก็สามารถสร้าง digital avatar แบบกำหนดเองที่มีรูปลักษณ์และเสียงที่เหมือนกับตนเองอย่างน่าทึ่ง ฟีเจอร์นี้ได้รับการออกแบบมาเพื่อเพิ่มความคล่องตัวในการผลิตวิดีโออัปเดตบริษัท วิดีโอฝึกอบรม และการสื่อสารภายในองค์กร โดยไม่จำเป็นต้องถ่ายทำซ้ำๆ อยู่ตลอดเวลา
เพื่อจัดการกับข้อกังวลด้านจริยธรรมเกี่ยวกับ deepfakes Google กำลังนำมาตรการป้องกันที่เข้มงวดมาใช้ โดย digital avatar ส่วนบุคคลเหล่านี้จะถูกผูกไว้กับบัญชี Google ของผู้ใช้โดยเฉพาะ และมีการใส่ลายน้ำแบบล่องหนด้วยเทคโนโลยี SynthID การเข้าถึงฟีเจอร์ avatar เหล่านี้ในปัจจุบันจำกัดเฉพาะผู้ใช้ที่มีอายุ 18 ปีขึ้นไปในบางภูมิภาค เพื่อให้มั่นใจว่าการเปิดตัวสื่อสังเคราะห์ที่มีความสมจริงสูงนี้จะเป็นไปอย่างมีการควบคุม
ขับเคลื่อนความคิดสร้างสรรค์ด้วย Gemini Omni
วิวัฒนาการของ Google Vids ได้รับแรงขับเคลื่อนจากการผสานรวม Gemini Omni ซึ่งเป็นโมเดล AI แบบ multi-modal ขั้นสูงของ Google การผสานรวมนี้ช่วยให้เกิดเวิร์กโฟลว์แบบ "prompt-to-video" ที่ซับซ้อน โดยผู้ใช้สามารถรวมคำสั่งข้อความ (text prompts) เข้ากับรูปภาพอ้างอิงที่อัปโหลดได้ Gemini Omni จะสังเคราะห์ข้อมูลนำเข้าที่แตกต่างกันเหล่านี้เพื่อสร้างลำดับวิดีโอที่สอดคล้องกัน
นอกเหนือจากการสร้างขึ้นมาเฉยๆ แล้ว Gemini Omni ยังทำหน้าที่เป็นชุดเครื่องมือตัดต่อหลังการผลิต (post-production) ที่ชาญฉลาดอีกด้วย โมเดลนี้สามารถทำงานด้านภาพที่ซับซ้อนได้ เช่น การเปลี่ยนพื้นหลัง การแก้ไขปัญหาแสงจากการบันทึกด้วยโทรศัพท์มือถือ และการเพิ่มเอฟเฟกต์แบบภาพยนตร์ ที่สำคัญคือ การอัปเดตนี้ได้เพิ่มการรองรับการแก้ไขแบบทีละขั้นตอน (step-by-step edits) ซึ่งช่วยให้ผู้สร้างสามารถปรับเปลี่ยนรายละเอียดเล็กๆ น้อยๆ ในโปรเจกต์ได้อย่างต่อเนื่องในระหว่างการทำงาน ช่วยลดความหงุดหงิดจากการที่ต้องเริ่มเรนเดอร์ใหม่ทั้งหมดเมื่อต้องการปรับเปลี่ยนเพียงรายละเอียดเดียว
การเปลี่ยนแปลงภูมิทัศน์การแข่งขัน
การอัปเดตเหล่านี้แสดงถึงการปรับเปลี่ยนกลยุทธ์ของ Google แม้ว่าในตอนแรก Vids จะถูกวางตำแหน่งเป็นเครื่องมือช่วยนำเสนอด้วย AI สำหรับ Google Workspace แต่ปัจจุบันกำลังพัฒนาอย่างรวดเร็วไปสู่แพลตฟอร์มการสร้างวิดีโอแบบครบวงจร ด้วยการฝังความสามารถเหล่านี้ลงในระบบนิเวศของ Workspace โดยตรง Google กำลังก้าวข้ามการเป็นเพียงเครื่องมือทำสไลด์นำเสนอ และเข้าสู่ขอบเขตของการผลิตวิดีโอระดับไฮเอนด์
วิวัฒนาการนี้ทำให้ Google เข้าสู่การแข่งขันโดยตรงกับสตาร์ทอัพด้านวิดีโอ AI เฉพาะทาง เช่น HeyGen, Synthesia, Captions และ D-ID ในขณะที่แพลตฟอร์มเหล่านั้นมุ่งเน้นไปที่ผู้นำเสนอแบบสังเคราะห์ (synthetic presenters) เป็นหลัก แต่ข้อได้เปรียบของ Google อยู่ที่การผสานรวมที่ไร้รอยต่อกับเวิร์กโฟลว์ขององค์กรที่มีอยู่ สำหรับผู้ก่อตั้งและนักพัฒนา สิ่งนี้ส่งสัญญาณถึงแนวโน้มที่โมเดลแบบ multi-modal อย่าง Gemini Omni กำลังเปลี่ยนจากการเป็นเพียงการทดลองในงานวิจัย ไปสู่การเป็นส่วนประกอบสำคัญที่โต้ตอบได้ในชุดเครื่องมือเพิ่มประสิทธิภาพการทำงานระดับมืออาชีพ
สรุปประเด็นสำคัญ
- Custom Digital Twins: ผู้ใช้สามารถสร้าง AI avatars ได้โดยใช้เพียงรูปเซลฟี่และบันทึกเสียง ช่วยให้การส่งข้อความผ่านวิดีโอมืออาชีพมีความคล่องตัวมากขึ้น
- Multi-modal Editing: การผสานรวม Gemini Omni ช่วยให้สามารถสร้างวิดีโอที่ซับซ้อนผ่านคำสั่ง (prompt-based) และแก้ไขภาพแบบทีละขั้นตอนได้อย่างต่อเนื่อง
- Enterprise-Grade Safety: Digital avatar ส่วนบุคคลทั้งหมดได้รับการปกป้องด้วยการใส่ลายน้ำแบบล่องหนของ SynthID และถูกผูกไว้กับบัญชี Google ที่ผ่านการยืนยันตัวตนเพื่อป้องกันการนำไปใช้ในทางที่ผิด
