Google DeepMind از GenCeption رونمایی کرد؛ مدلی که یک مولد متن به ویدیو را با استفاده از تنها ۷۵۰۰ ویدیوی مصنوعی، به یک مدل پایه واحد برای طیف وسیعی از وظایف بینایی تبدیل می‌کند. ادعای این مدل ساده است: یک مولد ویدیو که از قبل می‌داند اشیاء چگونه حرکت می‌کنند و با هم تعامل دارند، می‌تواند بدون نیاز به ساخت یک شبکه مجزا برای هر وظیفه، برای پیش‌بینی عمق، نرمال‌های سطحی، ماسک‌های بخش‌بندی و ژست سه‌بعدی (3D pose) بازطراحی شود.

از خط لوله‌های بینایی پراکنده تا یک مدل یکپارچه

مدل‌های زبانی بزرگ با یادگیری پیش‌بینی کلمه بعدی، همه‌کاره شدند. در مقابل، تحقیقات بینایی کامپیوتری همچنان با سیستم‌های متخصص دست‌وپنجه نرم می‌کنند؛ یکی برای بخش‌بندی، دیگری برای عمق و دیگری برای تشخیص ژست. GenCeption این وصله‌پینه را کنار می‌گذارد. یک دستور متنی (prompt) به مدل می‌گوید که چه خروجی‌ای تولید کند و همان معماری ۱۴ میلیارد پارامتری، نقشه‌های عمق، نقشه‌های نرمال، ماسک‌های بخش‌بندی یا پیش‌بینی نقاط کلیدی را ارائه می‌دهد. این سیستم با در نظر گرفتن هر خروجی به عنوان یک تصویر RGB استاندارد سه کاناله، خط لوله را یکپارچه نگه می‌دارد؛ برای وظایفی که به‌طور طبیعی تصویر تولید نمی‌کنند، محققان ماژول‌های کوچک قابل آموزش را اضافه کرده‌اند.

آموزش بر روی یک مجموعه داده مصنوعی بسیار کوچک

تیم تحقیق، یک مجموعه داده مصنوعی در Blender ساخت و ۷۵۰۰ ویدیوی کوتاه را از ۸۰۰ مدل انسان دیجیتال که توسط ۲۰۰ توالی ضبط حرکت (motion-capture) هدایت می‌شدند، رندر کرد. مدل‌های سنتی تولید ویدیو مانند D4RT یا VGGT Omega بر روی میلیون‌ها کلیپ آموزش می‌بینند؛ اما GenCeption در حالی که بین یک‌هفتم تا یک‌پانصد‌مهم از آن داده‌ها را مصرف می‌کند، به عملکردی مشابه یا بهتر دست می‌یابد. بنچمارک‌های گزارش‌شده عبارتند از:

  • تخمین عمق در سطح مدل‌های تخصصی مانند DepthAnything 3.
  • پیش‌بینی نرمال سطحی که از NormalCrafter و Lotus-2 پیشی می‌گیرد.
  • تشخیص ژست سه‌بعدی که از Genmo و TRAM فراتر می‌رود.
  • بخش‌بندی هدایت‌شده با زبان که با قدرت ترکیبی SAM 3 از Meta و Gemini 3.5 Flash برابری می‌کند.

نویسندگان می‌گویند هدف مولد (generative objective) باعث می‌شود شبکه، هندسه و فیزیک صحنه را درونی‌سازی کند که سپس به وظایف ادراکی پایین‌دستی منتقل می‌شود.

میان‌برهای معماری برای سرعت بیشتر

GenCeption بر پایه مدل ویدیویی متن‌باز Wan2.1 شرکت Alibaba ساخته شده است. محققان به جای فرآیند معمول انتشار (diffusion) که فریم‌ها را در چندین تکرار اصلاح می‌کند، سیستم را به‌گونه‌ای بازطراحی کردند که پیش‌بینی را تنها در یک گذر مستقیم (forward pass) واحد ارائه دهد. نتیجه این است: مدل یک کلیپ ۸۱ فریم را در حدود ده ثانیه روی سخت‌افزارهای فعلی پردازش می‌کند. اندازه ۱۴ میلیارد پارامتری همچنان بزرگ است، اما صرفه‌جویی در آموزش و حذف شبکه‌های متعددِ مختص به هر وظیفه، منجر به بهبود قابل توجهی در کارایی شده است.

چرا جامعه هوش مصنوعی باید توجه کند

اگر یک مولد ویدیو بتواند به عنوان یک «مدل جهان» (world model) عمل کند — یعنی بازنمایی‌ای که چگونگی اشغال فضا توسط اشیاء و حرکت آن‌ها در طول زمان را ثبت می‌کند — آنگاه جهش بعدی در هوش مصنوعی بینایی ممکن است به جای برچسب‌گذاری مجموعه‌داده‌های بزرگ‌تر و بزرگ‌تر، از طریق مقیاس‌پذیری قابلیت‌های مولد حاصل شود. یک مدل واحد و مبتنی بر دستور متنی می‌تواند خط لوله‌های محصول را ساده‌تر کند، هزینه‌های مهندسی را کاهش دهد و مانع ورود توسعه‌دهندگانی را که به ویژگی‌های بینایی نیاز دارند اما منابع کافی برای آموزش چندین شبکه متخصص را ندارند، از میان بردارد.

ملاحظات و سوالات بی‌پاسخ

اعداد عملکرد از داده‌های مصنوعی و مجموعه‌های بنچمارکی به دست آمده‌اند که ممکن است بازتاب‌دهنده آشفتگی‌های ویدیوهای دنیای واقعی نباشند. تعمیم‌پذیری مدل به نورپردازی کنترل‌نشده، شرایط آب‌وهوایی یا حرکت دوربین هنوز اثبات نشده است. استنتاج ده ثانیه‌ای برای یک کلیپ ۸۱ فریم، اگرچه سریع‌تر از انتشار تکرار شونده است، اما هنوز با حالت بلادرنگ (real-time) برای رباتیک یا واقعیت افزوده (AR) فاصله زیادی دارد. علاوه بر این، ۱۴ میلیارد پارامتر مدل نیازمند بودجه محاسباتی قابل توجهی برای استقرار است که می‌تواند دسترسی به آن را در خارج از آزمایشگاه‌های با بودجه بالا محدود کند.

آنچه باید در آینده زیر نظر داشت

  • اعتبارسنجی در دنیای واقعی: مطالعاتی که GenCeption را روی ویدیوهای رانندگی در فضای باز، ویدیوهای گوشی‌های دستی یا صحنه‌های بازرسی صنعتی آزمایش می‌کنند.
  • مقیاس‌پذیری مدل: اینکه آیا نسخه‌های بزرگ‌تر یا با آموزش کارآمدتر می‌توانند شکاف تأخیر را در عین حفظ کارایی داده‌ها پر کنند یا خیر.
  • مسیرهای یکپارچه‌سازی: اینکه چگونه ارائه‌دهندگان ابری یا پلتفرم‌های edge-AI ممکن است یک API واحد ارائه دهند که توصیف متنی وظیفه را بپذیرد و خروجی بصری مناسب را بازگرداند.
  • منابع آموزشی جایگزین: تلاش برای ترکیب کلیپ‌های مصنوعی با مقدار اندکی از ویدیوهای واقعی برای بهبود استحکام مدل.

نکته کلیدی

GenCeption نشان می‌دهد که یک موتور تولید ویدئو می‌تواند نقش یک مدل پایه بینایی چندوظیفه‌ای را نیز ایفا کند و در عین یادگیری از مجموعه‌داده‌ای که چندین مرتبه کوچک‌تر از رویکردهای سنتی است، خروجی‌های پیشرفته‌ای در زمینه‌های عمق، نرمال‌ها، پوز و بخش‌بندی ارائه دهد. نویدبخش بودن این فناوری در ادغام انبوهی از شبکه‌های تخصصی در قالب یک سیستم واحد مبتنی بر پرامپت نهفته است؛ آزمون بعدی آن این خواهد بود که آیا این وعده می‌تواند از محیط آزمایشگاه‌های مصنوعی عبور کرده و در دنیای غیرقابل‌پیش‌بینی بیرون دوام بیاورد یا خیر.