أعلنت Google DeepMind عن GenCeption، وهو نموذج يحول مولد الفيديو من نص (text-to-video) إلى نموذج أساسي واحد لمجموعة من مهام الرؤية، باستخدام 7,500 فيديو اصطناعي فقط. والادعاء هنا بسيط: إن مولد الفيديو الذي يعرف بالفعل كيفية تحرك الأشياء وتفاعلها يمكن إعادة توظيفه للتنبؤ بالعمق (depth)، والناظم السطحي (surface normals)، وأقنعة التجزئة (segmentation masks)، والوضعية ثلاثية الأبعاد (3D pose) دون الحاجة لبناء شبكة منفصلة لكل مهمة.

من مسارات الرؤية المجزأة إلى نموذج موحد

أصبحت النماذج اللغوية الكبيرة متعددة الاستخدامات من خلال تعلم التنبؤ بالكلمة التالية. وفي المقابل، لا تزال أبحاث الرؤية الحاسوبية تتعامل مع أنظمة متخصصة—نظام للتجزئة، وآخر للعمق، وثالث للوضعية. يتجاوز GenCeption هذا التشتت؛ حيث يخبر نص الأمر (prompt) النموذج بالمخرجات المطلوب إنتاجها، وتقوم البنية نفسها المكونة من 14 مليار معلمة (parameter) بتقديم خرائط العمق، أو خرائط الناظم السطحي، أو أقنعة التجزئة، أو تنبؤات النقاط الرئيسية (keypoint predictions). ومن خلال معاملة كل مخرج كصورة RGB قياسية ثلاثية القنوات، يحافظ النظام على توحيد مسار العمل؛ وبالنسبة للمهام التي لا تنتج صورًا بشكل طبيعي، أضاف الباحثون وحدات صغيرة قابلة للتدريب.

التدريب على مجموعة بيانات اصطناعية ضئيلة

قام الفريق ببناء مجموعة بيانات اصطناعية في Blender، حيث تم رندرة 7,500 فيديو قصير من 800 نموذج بشري رقمي مدفوعة بـ 200 تسلسل لالتقاط الحركة. وبينما تتدرب نماذج توليد الفيديو التقليدية مثل D4RT أو VGGT Omega على ملايين المقاطع، يحقق GenCeption أداءً مماثلاً أو أفضل مع استهلاك ما بين سبع واحد إلى جزء من 500 من تلك البيانات. وتشمل المعايير المرجعية المُبلغ عنها ما يلي:

  • تقدير العمق (Depth estimation) بمستوى يضاهي النماذج المتخصصة مثل DepthAnything 3.
  • التنبؤ بالناظم السطحي (Surface-normal prediction) الذي يتفوق على NormalCrafter و Lotus-2.
  • التعرف على الوضعية ثلاثية الأبعاد (3D pose recognition) متجاوزًا Genmo و TRAM.
  • التجزئة الموجهة باللغة (Language-guided segmentation) التي تضاهي القوة المشتركة لنموذجي SAM 3 و Gemini 3.5 Flash من Meta.

ويقول المؤلفون إن الهدف التوليدي يجبر الشبكة على استيعاب هندسة المشهد وفيزيائه داخليًا، وهو ما ينتقل بعد ذلك إلى مهام الإدراك اللاحقة.

اختصارات معمارية من أجل السرعة

يعتمد GenCeption على نموذج Wan2.1 مفتوح المصدر من Alibaba. وبدلاً من عملية الانتشار (diffusion) المعتادة التي تعمل على تحسين الإطارات عبر دورات عديدة، أعاد الباحثون هندسة النظام لإصدار التنبؤ في تمريرة أمامية (forward pass) واحدة. والنتيجة: يعالج النموذج مقطعًا مكونًا من 81 إطارًا في حوالي عشر ثوانٍ على الأجهزة الحالية. ورغم أن حجم الـ 14 مليار معلمة لا يزال كبيرًا، إلا أن التوفير في التدريب وإلغاء الشبكات المتعددة الخاصة بكل مهمة يحقق مكاسب كبيرة في الكفاءة.

لماذا يجب على مجتمع الذكاء الاصطناعي الانتباه

إذا كان بإمكان مولد الفيديو أن يعمل أيضًا كـ "نموذج عالم" (world model)—وهو تمثيل يجسد كيفية احتلال الأشياء للمساحة وتحركها بمرور الوقت—فإن القفزة التالية في الذكاء الاصطناعي البصري قد تأتي من توسيع القدرات التوليدية بدلاً من وسم مجموعات بيانات أكبر فأكبر. يمكن لنموذج واحد مدفوع بالأوامر النصية أن يبسط مسارات المنتجات، ويقلل التكاليف الهندسية، ويخفض الحاجز أمام المطورين الذين يحتاجون إلى ميزات الرؤية ولكنهم يفتقرون إلى الموارد لتدريب شبكات متخصصة متعددة.

محاذير وأسئلة بلا إجابات

تأتي أرقام الأداء من بيانات اصطناعية ومجموعات معايير مرجعية قد لا تعكس فوضى لقطات العالم الحقيقي. ولا يزال التعميم على الإضاءة غير المنضبطة، أو الطقس، أو حركة الكاميرا غير مثبت. كما أن زمن الاستدلال (inference) البالغ عشر ثوانٍ لمقطع مكون من 81 إطارًا، رغم كونه أسرع من الانتشار التكراري، لا يزال بعيدًا عن الوقت الفعلي (real-time) اللازم للروبوتات أو الواقع المعزز (AR). علاوة على ذلك، تتطلب معلمات النموذج البالغة 14 مليار معلمة ميزانية حوسبة كبيرة للنشر، مما قد يحد من إمكانية الوصول إليه خارج المختبرات ذات التمويل الجيد.

ما يجب مراقبته لاحقًا

  • التحقق في العالم الحقيقي: الدراسات التي تختبر GenCeption على فيديوهات القيادة في الهواء الطلق، أو لقطات الهاتف المحمول، أو مشاهد الفحص الصناعي.
  • توسيع نطاق النموذج: ما إذا كانت الإصدارات الأكبر أو التي تم تدريبها بكفاءة أعلى يمكنها سد فجوة زمن الاستجابة مع الحفاظ على كفاءة البيانات.
  • مسارات التكامل: كيف يمكن لمزودي الخدمات السحابية أو منصات ذكاء الحافة (edge-AI) توفير واجهة برمجة تطبيقات (API) واحدة تقبل وصفًا نصيًا للمهمة وتعيد المخرج البصري المناسب.
  • مصادر التدريب البديلة: الجهود المبذولة لدمج المقاطع الاصطناعية مع كمية متواضعة من الفيديو الحقيقي لتحسين المتانة.

الخلاصة

تُظهر GenCeption أن محرك توليد الفيديو يمكنه العمل أيضاً كنموذج رؤية أساسي متعدد المهام، حيث يقدم نتائج متطورة للغاية في تحديد العمق، والناظميات، والوضعية، والتقسيم، مع التعلم من مجموعة بيانات أصغر بمراحل كبيرة من النهج التقليدية. وتكمن وعوده في اختزال حشد من الشبكات المتخصصة في نظام واحد يعتمد على الأوامر النصية؛ وسيكون اختباره التالي هو مدى صمود هذا الوعد عند الانتقال من المختبرات الاصطناعية إلى العالم الخارجي غير المتوقع.