Google DeepMind از GenCeption رونمایی کرد؛ مدلی که یک مولد متن به ویدیو را با استفاده از تنها ۷۵۰۰ ویدیوی مصنوعی، به یک مدل پایه واحد برای طیف وسیعی از وظایف بینایی تبدیل میکند. ادعای این مدل ساده است: یک مولد ویدیو که از قبل میداند اشیاء چگونه حرکت میکنند و با هم تعامل دارند، میتواند بدون نیاز به ساخت یک شبکه مجزا برای هر وظیفه، برای پیشبینی عمق، نرمالهای سطحی، ماسکهای بخشبندی و ژست سهبعدی (3D pose) بازطراحی شود.
از خط لولههای بینایی پراکنده تا یک مدل یکپارچه
مدلهای زبانی بزرگ با یادگیری پیشبینی کلمه بعدی، همهکاره شدند. در مقابل، تحقیقات بینایی کامپیوتری همچنان با سیستمهای متخصص دستوپنجه نرم میکنند؛ یکی برای بخشبندی، دیگری برای عمق و دیگری برای تشخیص ژست. GenCeption این وصلهپینه را کنار میگذارد. یک دستور متنی (prompt) به مدل میگوید که چه خروجیای تولید کند و همان معماری ۱۴ میلیارد پارامتری، نقشههای عمق، نقشههای نرمال، ماسکهای بخشبندی یا پیشبینی نقاط کلیدی را ارائه میدهد. این سیستم با در نظر گرفتن هر خروجی به عنوان یک تصویر RGB استاندارد سه کاناله، خط لوله را یکپارچه نگه میدارد؛ برای وظایفی که بهطور طبیعی تصویر تولید نمیکنند، محققان ماژولهای کوچک قابل آموزش را اضافه کردهاند.
آموزش بر روی یک مجموعه داده مصنوعی بسیار کوچک
تیم تحقیق، یک مجموعه داده مصنوعی در Blender ساخت و ۷۵۰۰ ویدیوی کوتاه را از ۸۰۰ مدل انسان دیجیتال که توسط ۲۰۰ توالی ضبط حرکت (motion-capture) هدایت میشدند، رندر کرد. مدلهای سنتی تولید ویدیو مانند D4RT یا VGGT Omega بر روی میلیونها کلیپ آموزش میبینند؛ اما GenCeption در حالی که بین یکهفتم تا یکپانصدمهم از آن دادهها را مصرف میکند، به عملکردی مشابه یا بهتر دست مییابد. بنچمارکهای گزارششده عبارتند از:
- تخمین عمق در سطح مدلهای تخصصی مانند DepthAnything 3.
- پیشبینی نرمال سطحی که از NormalCrafter و Lotus-2 پیشی میگیرد.
- تشخیص ژست سهبعدی که از Genmo و TRAM فراتر میرود.
- بخشبندی هدایتشده با زبان که با قدرت ترکیبی SAM 3 از Meta و Gemini 3.5 Flash برابری میکند.
نویسندگان میگویند هدف مولد (generative objective) باعث میشود شبکه، هندسه و فیزیک صحنه را درونیسازی کند که سپس به وظایف ادراکی پاییندستی منتقل میشود.
میانبرهای معماری برای سرعت بیشتر
GenCeption بر پایه مدل ویدیویی متنباز Wan2.1 شرکت Alibaba ساخته شده است. محققان به جای فرآیند معمول انتشار (diffusion) که فریمها را در چندین تکرار اصلاح میکند، سیستم را بهگونهای بازطراحی کردند که پیشبینی را تنها در یک گذر مستقیم (forward pass) واحد ارائه دهد. نتیجه این است: مدل یک کلیپ ۸۱ فریم را در حدود ده ثانیه روی سختافزارهای فعلی پردازش میکند. اندازه ۱۴ میلیارد پارامتری همچنان بزرگ است، اما صرفهجویی در آموزش و حذف شبکههای متعددِ مختص به هر وظیفه، منجر به بهبود قابل توجهی در کارایی شده است.
چرا جامعه هوش مصنوعی باید توجه کند
اگر یک مولد ویدیو بتواند به عنوان یک «مدل جهان» (world model) عمل کند — یعنی بازنماییای که چگونگی اشغال فضا توسط اشیاء و حرکت آنها در طول زمان را ثبت میکند — آنگاه جهش بعدی در هوش مصنوعی بینایی ممکن است به جای برچسبگذاری مجموعهدادههای بزرگتر و بزرگتر، از طریق مقیاسپذیری قابلیتهای مولد حاصل شود. یک مدل واحد و مبتنی بر دستور متنی میتواند خط لولههای محصول را سادهتر کند، هزینههای مهندسی را کاهش دهد و مانع ورود توسعهدهندگانی را که به ویژگیهای بینایی نیاز دارند اما منابع کافی برای آموزش چندین شبکه متخصص را ندارند، از میان بردارد.
ملاحظات و سوالات بیپاسخ
اعداد عملکرد از دادههای مصنوعی و مجموعههای بنچمارکی به دست آمدهاند که ممکن است بازتابدهنده آشفتگیهای ویدیوهای دنیای واقعی نباشند. تعمیمپذیری مدل به نورپردازی کنترلنشده، شرایط آبوهوایی یا حرکت دوربین هنوز اثبات نشده است. استنتاج ده ثانیهای برای یک کلیپ ۸۱ فریم، اگرچه سریعتر از انتشار تکرار شونده است، اما هنوز با حالت بلادرنگ (real-time) برای رباتیک یا واقعیت افزوده (AR) فاصله زیادی دارد. علاوه بر این، ۱۴ میلیارد پارامتر مدل نیازمند بودجه محاسباتی قابل توجهی برای استقرار است که میتواند دسترسی به آن را در خارج از آزمایشگاههای با بودجه بالا محدود کند.
آنچه باید در آینده زیر نظر داشت
- اعتبارسنجی در دنیای واقعی: مطالعاتی که GenCeption را روی ویدیوهای رانندگی در فضای باز، ویدیوهای گوشیهای دستی یا صحنههای بازرسی صنعتی آزمایش میکنند.
- مقیاسپذیری مدل: اینکه آیا نسخههای بزرگتر یا با آموزش کارآمدتر میتوانند شکاف تأخیر را در عین حفظ کارایی دادهها پر کنند یا خیر.
- مسیرهای یکپارچهسازی: اینکه چگونه ارائهدهندگان ابری یا پلتفرمهای edge-AI ممکن است یک API واحد ارائه دهند که توصیف متنی وظیفه را بپذیرد و خروجی بصری مناسب را بازگرداند.
- منابع آموزشی جایگزین: تلاش برای ترکیب کلیپهای مصنوعی با مقدار اندکی از ویدیوهای واقعی برای بهبود استحکام مدل.
نکته کلیدی
GenCeption نشان میدهد که یک موتور تولید ویدئو میتواند نقش یک مدل پایه بینایی چندوظیفهای را نیز ایفا کند و در عین یادگیری از مجموعهدادهای که چندین مرتبه کوچکتر از رویکردهای سنتی است، خروجیهای پیشرفتهای در زمینههای عمق، نرمالها، پوز و بخشبندی ارائه دهد. نویدبخش بودن این فناوری در ادغام انبوهی از شبکههای تخصصی در قالب یک سیستم واحد مبتنی بر پرامپت نهفته است؛ آزمون بعدی آن این خواهد بود که آیا این وعده میتواند از محیط آزمایشگاههای مصنوعی عبور کرده و در دنیای غیرقابلپیشبینی بیرون دوام بیاورد یا خیر.
