Google DeepMind mengumumkan GenCeption, sebuah model yang menukarkan penjana teks-ke-video kepada satu model asas tunggal untuk pelbagai tugasan penglihatan, dengan hanya menggunakan 7,500 video sintetik. Dakwaan tersebut adalah ringkas: penjana video yang sudah memahami cara objek bergerak dan berinteraksi boleh digunakan semula untuk meramal kedalaman, normal permukaan, topeng segmentasi dan pose 3D tanpa perlu membina rangkaian berasingan bagi setiap satu.
Daripada saluran penglihatan yang terfragmentasi kepada model bersatu
Model bahasa besar menjadi serba boleh dengan mempelajari cara meramal perkataan seterusnya. Sebaliknya, penyelidikan penglihatan komputer masih mengendalikan sistem pakar yang berasingan—satu untuk segmentasi, satu lagi untuk kedalaman, dan satu lagi untuk pose. GenCeption melangkaui sistem yang tidak teratur itu. Satu arahan teks memberitahu model output mana yang perlu dihasilkan, dan seni bina 14 bilion parameter yang sama memberikan peta kedalaman, peta normal, topeng segmentasi atau ramalan titik kunci. Dengan menganggap setiap output sebagai imej RGB tiga saluran yang standard, sistem ini mengekalkan saluran yang seragam; bagi tugasan yang tidak menghasilkan imej secara semula jadi, penyelidik telah menambah modul kecil yang boleh dilatih.
Latihan pada korpus sintetik yang kecil
Pasukan tersebut membina set data sintetik dalam Blender, dengan merender 7,500 video pendek daripada 800 model manusia digital yang dipacu oleh 200 jujukan tangkapan gerak. Model penjanaan video tradisional seperti D4RT atau VGGT Omega dilatih menggunakan berjuta-juta klip; GenCeption mencapai prestasi yang setanding atau lebih baik sambil menggunakan antara satu per tujuh hingga satu per lima ratus daripada jumlah data tersebut. Penanda aras yang dilaporkan termasuk:
- Anggaran kedalaman yang setanding dengan model pakar seperti DepthAnything 3.
- Ramalan normal permukaan yang mengatasi NormalCrafter dan Lotus-2.
- Pengecaman pose 3D yang melampaui Genmo dan TRAM.
- Segmentasi berpandukan bahasa yang menyamai kekuatan gabungan SAM 3 Meta dan Gemini 3.5 Flash.
Penulis menyatakan bahawa objektif generatif memaksa rangkaian untuk menghadam geometri dan fizik pemandangan, yang kemudiannya dipindahkan kepada tugasan persepsi hiliran.
Jalan pintas seni bina untuk kelajuan
GenCeption dibina berasaskan model video sumber terbuka Wan2.1 milik Alibaba. Berbanding proses difusi biasa yang memperhalusi bingkai melalui banyak iterasi, penyelidik telah mereka bentuk semula sistem tersebut untuk mengeluarkan ramalan dalam satu laluan hadapan tunggal (single forward pass). Hasilnya: model ini memproses klip 81 bingkai dalam masa kira-kira sepuluh saat pada perkakasan semasa. Saiz 14 bilion parameter kekal besar, tetapi penjimatan latihan dan penghapusan pelbagai rangkaian khusus tugasan memberikan peningkatan kecekapan yang ketara.
Mengapa komuniti AI perlu memberi perhatian
Jika penjana video boleh berfungsi sebagai "model dunia"—satu representasi yang menangkap cara objek memenuhi ruang dan bergerak mengikut masa—maka lonjakan seterusnya dalam AI visual mungkin datang daripada penskalaan keupayaan generatif dan bukannya melabel set data yang semakin besar. Satu model tunggal yang dipacu oleh arahan boleh memudahkan saluran produk, mengurangkan kos overhed kejuruteraan, dan merendahkan halangan bagi pembangun yang memerlukan ciri penglihatan tetapi kekurangan sumber untuk melatih pelbagai rangkaian pakar.
Amaran dan persoalan yang belum terjawab
Angka prestasi tersebut datang daripada data sintetik dan set penanda aras yang mungkin tidak mencerminkan kekacauan rakaman dunia sebenar. Generalisasi terhadap pencahayaan, cuaca atau pergerakan kamera yang tidak terkawal masih belum terbukti. Inferens sepuluh saat untuk klip 81 bingkai, walaupun lebih pantas daripada difusi iteratif, masih jauh daripada masa nyata (real-time) untuk robotik atau AR. Selain itu, 14 bilion parameter model ini memerlukan bajet pengkomputeran yang besar untuk penggunaan, yang boleh mengehadkan aksesibiliti di luar makmal yang mempunyai dana besar.
Apa yang perlu diperhatikan seterusnya
- Pengesahan dunia sebenar: kajian yang menguji GenCeption pada video pemanduan luar bangunan, rakaman telefon bimbit, atau senario pemeriksaan industri.
- Penskalaan model: sama ada versi yang lebih besar atau yang dilatih dengan lebih cekap dapat merapatkan jurang kependaman sambil mengekalkan kecekapan data.
- Laluan integrasi: bagaimana penyedia awan atau platform edge-AI mungkin menyediakan satu API tunggal yang menerima penerangan tugasan tekstual dan mengembalikan output visual yang sesuai.
- Sumber latihan alternatif: usaha untuk mencampurkan klip sintetik dengan sejumlah kecil video sebenar untuk meningkatkan keteguhan (robustness).
Kesimpulan
GenCeption menunjukkan bahawa enjin penjanaan video boleh bertindak sebagai model asas visi pelbagai tugas, memberikan kedalaman, normal, pose, dan segmentasi yang tercanggih sambil belajar daripada set data yang beberapa kali ganda lebih kecil berbanding pendekatan tradisional. Janjinya terletak pada penggabungan pelbagai rangkaian pakar ke dalam satu sistem dipacu prom; ujian seterusnya adalah sama ada janji tersebut dapat bertahan apabila beralih daripada makmal sintetik ke dunia luar yang tidak menentu.
