Google DeepMind ประกาศเปิดตัว GenCeption โมเดลที่เปลี่ยนเครื่องมือสร้างวิดีโอจากข้อความ (text-to-video generator) ให้กลายเป็นโมเดลพื้นฐาน (foundation model) หนึ่งเดียวสำหรับงานด้านวิทัศน์ (vision tasks) ที่หลากหลาย โดยใช้เพียงวิดีโอสังเคราะห์ 7,500 คลิปเท่านั้น ข้อกล่าวอ้างนั้นเรียบง่าย: เครื่องมือสร้างวิดีโอที่รู้อยู่แล้วว่าวัตถุเคลื่อนที่และมีปฏิสัมพันธ์กันอย่างไร สามารถนำมาปรับใช้เพื่อทำนายความลึก (depth), พื้นผิวปกติ (surface normals), หน้ากากการแบ่งส่วน (segmentation masks) และท่าทาง 3 มิติ (3D pose) ได้ โดยไม่จำเป็นต้องสร้างเครือข่ายแยกต่างหากสำหรับแต่ละงาน
จากพายพไลน์วิทัศน์ที่กระจัดกระจายสู่โมเดลที่เป็นหนึ่งเดียว
โมเดลภาษาขนาดใหญ่ (Large language models) กลายเป็นโมเดลที่ใช้งานได้หลากหลายจากการเรียนรู้ที่จะทำนายคำถัดไป ในทางตรงกันข้าม งานวิจัยด้านคอมพิวเตอร์วิทัศน์ (Computer-vision) ยังคงต้องจัดการกับระบบเฉพาะทางหลายระบบ เช่น ระบบหนึ่งสำหรับการแบ่งส่วน (segmentation) อีกระบบสำหรับความลึก และอีกระบบสำหรับท่าทาง (pose) แต่ GenCeption ข้ามขั้นตอนที่ยุ่งยากเหล่านั้นไป เพียงแค่ใช้คำสั่งข้อความ (text prompt) บอกโมเดลว่าต้องการผลลัพธ์แบบใด สถาปัตยกรรมขนาด 1.4 หมื่นล้านพารามิเตอร์เดียวกันนี้ก็สามารถส่งมอบทั้งแผนที่ความลึก (depth maps), แผนที่พื้นผิวปกติ (normal maps), หน้ากากการแบ่งส่วน (segmentation masks) หรือการทำนายจุดสำคัญ (keypoint predictions) ได้ ด้วยการปฏิบัติกับทุกผลลัพธ์ให้เป็นภาพ RGB แบบสามช่องสัญญาณมาตรฐาน ระบบจึงรักษาพายพไลน์ให้มีความสม่ำเสมอ สำหรับงานที่ไม่สามารถสร้างภาพออกมาได้โดยธรรมชาติ นักวิจัยได้เพิ่มโมดูลขนาดเล็กที่สามารถฝึกฝนได้เข้าไปเสริม
การฝึกฝนบนคลังข้อมูลสังเคราะห์ขนาดเล็ก
ทีมงานได้สร้างชุดข้อมูลสังเคราะห์ใน Blender โดยเรนเดอร์วิดีโอสั้นๆ 7,500 คลิป จากโมเดลมนุษย์ดิจิทัล 800 แบบ ที่ขับเคลื่อนด้วยลำดับการจับการเคลื่อนไหว (motion-capture sequences) 200 ชุด โมเดลสร้างวิดีโอแบบดั้งเดิม เช่น D4RT หรือ VGGT Omega ต้องฝึกฝนกับคลิปวิดีโอหลายล้านคลิป แต่ GenCeption สามารถบรรลุประสิทธิภาพที่เทียบเท่าหรือดีกว่า โดยใช้ข้อมูลเพียง 1 ใน 7 ถึง 1 ใน 500 ของข้อมูลเหล่านั้น ผลการทดสอบเกณฑ์มาตรฐาน (benchmarks) ที่รายงานมีดังนี้:
- การประมาณความลึก (Depth estimation) ที่เทียบเท่ากับโมเดลเฉพาะทางอย่าง DepthAnything 3
- การทำนายพื้นผิวปกติ (Surface-normal prediction) ที่เอาชนะ NormalCrafter และ Lotus-2
- การจดจำท่าทาง 3 มิติ (3D pose recognition) ที่เหนือกว่า Genmo และ TRAM
- การแบ่งส่วนโดยใช้ภาษาเป็นตัวนำ (Language-guided segmentation) ที่เทียบเท่ากับความสามารถรวมกันของ SAM 3 และ Gemini 3.5 Flash จาก Meta
ผู้เขียนระบุว่า วัตถุประสงค์เชิงสร้างสรรค์ (generative objective) บังคับให้เครือข่ายต้องทำความเข้าใจเรขาคณิตและฟิสิกส์ของฉากจากภายใน ซึ่งจะส่งต่อความสามารถนี้ไปยังงานด้านการรับรู้ (perception tasks) ในขั้นตอนต่อๆ ไป
ทางลัดทางสถาปัตยกรรมเพื่อความเร็ว
GenCeption สร้างขึ้นบนโมเดลวิดีโอ Wan2.1 แบบโอเพนซอร์สของ Alibaba แทนที่จะใช้กระบวนการแพร่กระจาย (diffusion process) แบบปกติที่ต้องปรับปรุงเฟรมภาพผ่านการทำซ้ำหลายครั้ง นักวิจัยได้ออกแบบระบบใหม่เพื่อให้สามารถส่งผลลัพธ์การทำนายออกมาได้ในการส่งผ่านไปข้างหน้าเพียงครั้งเดียว (single forward pass) ผลลัพธ์ที่ได้คือ โมเดลสามารถประมวลผลคลิปความยาว 81 เฟรมได้ในเวลาประมาณสิบวินาทีบนฮาร์ดแวร์ปัจจุบัน แม้ขนาด 1.4 หมื่นล้านพารามิเตอร์จะยังคงใหญ่ แต่การประหยัดทรัพยากรในการฝึกฝนและการกำจัดเครือข่ายเฉพาะทางหลายตัวออกไป ช่วยให้เกิดประสิทธิภาพที่เพิ่มขึ้นอย่างมหาศาล
ทำไมชุมชน AI ควรให้ความสนใจ
หากเครื่องมือสร้างวิดีโอสามารถทำหน้าที่เป็น "โมเดลโลก" (world model) ได้ด้วย ซึ่งก็คือตัวแทนที่จับภาพว่าวัตถุครอบครองพื้นที่และเคลื่อนที่อย่างไรเมื่อเวลาผ่านไป ก้าวกระโดดถัดไปของ AI ด้านภาพอาจมาจากการขยายขีดความสามารถในการสร้างสรรค์ (generative capabilities) มากกว่าการทำเครื่องหมายข้อมูล (annotating) ในชุดข้อมูลที่ใหญ่ขึ้นเรื่อยๆ โมเดลเดียวที่ขับเคลื่อนด้วยคำสั่งอาจช่วยลดความซับซ้อนของพายพไลน์ผลิตภัณฑ์ ลดภาระงานด้านวิศวกรรม และลดอุปสรรคสำหรับนักพัฒนาที่ต้องการฟีเจอร์ด้านวิทัศน์แต่ขาดทรัพยากรในการฝึกฝนเครือข่ายเฉพาะทางหลายตัว
ข้อควรระวังและคำถามที่ยังไม่มีคำตอบ
ตัวเลขประสิทธิภาพมาจากข้อมูลสังเคราะห์และชุดทดสอบเกณฑ์มาตรฐาน ซึ่งอาจไม่สะท้อนถึงความวุ่นวายของฟุตเทจในโลกแห่งความเป็นจริง การปรับใช้ (Generalisation) กับสภาพแสง สภาพอากาศ หรือการเคลื่อนที่ของกล้องที่ไม่สามารถควบคุมได้ยังไม่ได้รับการพิสูจน์ การอนุมาน (inference) นานสิบวินาทีสำหรับคลิป 81 เฟรม แม้จะเร็วกว่าการทำ diffusion แบบซ้ำๆ แต่ก็ยังห่างไกลจากระดับเรียลไทม์สำหรับหุ่นยนต์หรือ AR นอกจากนี้ พารามิเตอร์ 1.4 หมื่นล้านตัวของโมเดลยังต้องการงบประมาณการประมวลผล (compute budget) ที่สูงในการนำไปใช้งานจริง ซึ่งอาจจำกัดการเข้าถึงสำหรับผู้ที่อยู่นอกห้องปฏิบัติการที่มีทุนสนับสนุนสูง
สิ่งที่ต้องจับตามองต่อไป
- การตรวจสอบในโลกแห่งความเป็นจริง: การศึกษาที่ทดสอบ GenCeption กับวิดีโอการขับขี่กลางแจ้ง, ฟุตเทจจากโทรศัพท์มือถือ หรือฉากการตรวจสอบในอุตสาหกรรม
- การขยายขนาดโมเดล: ดูว่าเวอร์ชันที่ใหญ่กว่าหรือฝึกฝนอย่างมีประสิทธิภาพมากกว่าจะสามารถลดช่องว่างด้านความหน่วง (latency) ในขณะที่ยังรักษาประสิทธิภาพด้านการใช้ข้อมูลไว้ได้หรือไม่
- แนวทางการบูรณาการ: ผู้ให้บริการคลาวด์หรือแพลตฟอร์ม edge-AI จะเปิดใช้งาน API เดียวที่รับคำอธิบายงานเป็นข้อความและส่งคืนผลลัพธ์ทางภาพที่เหมาะสมได้อย่างไร
- แหล่งข้อมูลการฝึกฝนทางเลือก: ความพยายามในการผสมผสานคลิปสังเคราะห์เข้ากับวิดีโอจริงในปริมาณที่เหมาะสมเพื่อเพิ่มความทนทาน (robustness)
บทสรุป
GenCeption แสดงให้เห็นว่าเอนจินสร้างวิดีโอสามารถทำหน้าที่เป็นโมเดลพื้นฐานด้านการมองเห็นแบบมัลติทาสก์ (multi-task vision foundation model) ได้ด้วย โดยสามารถให้ผลลัพธ์ด้านความลึก (depth), นอร์มัล (normals), ท่าทาง (pose) และการแบ่งส่วนภาพ (segmentation) ที่ล้ำสมัย ในขณะที่เรียนรู้จากชุดข้อมูลที่มีขนาดเล็กกว่าวิธีการแบบดั้งเดิมหลายเท่าตัว ศักยภาพของมันอยู่ที่การยุบรวมเครือข่ายเฉพาะทางที่หลากหลายและมากมายให้กลายเป็นระบบเดียวที่ขับเคลื่อนด้วยพรอมต์ (prompt-driven system) บททดสอบถัดไปคือศักยภาพนี้จะยังคงอยู่หรือไม่เมื่อต้องก้าวข้ามจากห้องแล็บจำลองไปสู่โลกภายนอกที่คาดเดาไม่ได้
