Google DeepMind ने GenCeption ची घोषणा केली आहे, जे एक असे मॉडेल आहे जे text-to-video जनरेटरला विविध vision tasks साठी एका सिंगल foundation model मध्ये रूपांतरित करते, आणि त्यासाठी केवळ ७,५०० synthetic videos चा वापर करते. दावा साधा आहे: ज्या व्हिडिओ जनरेटरला वस्तू कशा हालचाल करतात आणि एकमेकांशी कशा संवाद साधतात हे आधीच माहित आहे, त्याचा वापर प्रत्येक कार्यासाठी वेगळे नेटवर्क न बनवता depth, surface normals, segmentation masks आणि 3D pose प्रेडिक्ट करण्यासाठी केला जाऊ शकतो.

विखुरलेल्या vision pipelines पासून एका एकत्रित मॉडेलपर्यंत

Large language models पुढील शब्द ओळखण्यास शिकल्यामुळे अष्टपैलू बनले. याउलट, Computer-vision संशोधन अजूनही स्पेशलिस्ट सिस्टम्सवर अवलंबून आहे—segmentation साठी एक, depth साठी दुसरी आणि pose साठी तिसरी. GenCeption ही विखुरलेली पद्धत टाळते. एक text prompt मॉडेलला कोणता आउटपुट द्यायचा हे सांगतो, आणि तेच १४-billion-parameter आर्किटेक्चर depth maps, normal maps, segmentation masks किंवा keypoint predictions प्रदान करते. प्रत्येक आउटपुटला स्टँडर्ड तीन-चॅनेल RGB इमेज म्हणून मानल्यामुळे, ही सिस्टम पाइपलाइन एकसमान ठेवते; ज्या कामांसाठी नैसर्गिकरित्या इमेज तयार होत नाहीत, त्यासाठी संशोधकांनी लहान trainable modules जोडले आहेत.

एका लहान synthetic corpus वर प्रशिक्षण

टीमने Blender मध्ये एक synthetic dataset तयार केले, ज्यामध्ये २०० motion-capture sequences द्वारे चालवल्या जाणाऱ्या ८०० डिजिटल ह्युमन मॉडेल्सपासून ७,५०० लहान व्हिडिओ रेंडर केले गेले. D4RT किंवा VGGT Omega सारखी पारंपारिक व्हिडिओ-जनरेशन मॉडेल्स लाखो क्लिप्सवर प्रशिक्षित होतात; GenCeption त्या तुलनेत एक-सप्तवांश ते एक-पाचशेवांश डेटा वापरूनही तितकेच किंवा त्यापेक्षा चांगले प्रदर्शन करते. अहवालानुसार बेंचमार्कमध्ये खालील गोष्टींचा समावेश आहे:

  • DepthAnything 3 सारख्या स्पेशलाइज्ड मॉडेल्सच्या बरोबरीने depth estimation.
  • NormalCrafter आणि Lotus-2 पेक्षा सरस surface-normal prediction.
  • Genmo आणि TRAM पेक्षा सरस 3D pose recognition.
  • Meta च्या SAM 3 आणि Gemini 3.5 Flash च्या एकत्रित क्षमतेशी जुळणारे language-guided segmentation.

लेखकांच्या मते, generative objective मुळे नेटवर्कला सीनची भूमिती (geometry) आणि भौतिकशास्त्र (physics) अंतर्गत आत्मसात करण्यास भाग पडते, जे नंतर पुढील perception tasks साठी उपयुक्त ठरते.

वेगासाठी आर्किटेक्चरल शॉर्टकट्स

GenCeption हे Alibaba च्या open-source Wan2.1 व्हिडिओ मॉडेलवर आधारित आहे. अनेक iterations मध्ये फ्रेम्स सुधारणाऱ्या नेहमीच्या diffusion process ऐवजी, संशोधकांनी सिस्टमला एकाच forward pass मध्ये प्रेडिक्शन देण्यासाठी पुन्हा इंजिनिअर केले आहे. परिणाम: हे मॉडेल सध्याच्या हार्डवेअरवर ८१-फ्रेमची क्लिप साधारण दहा सेकंदात प्रोसेस करते. १४-billion-parameter आकार मोठा असला तरी, प्रशिक्षणातील बचत आणि अनेक कार्य-विशिष्ट नेटवर्क्सची गरज काढून टाकल्यामुळे कार्यक्षमतेमध्ये मोठी वाढ झाली आहे.

AI समुदायाने याकडे लक्ष का दिले पाहिजे

जर एखादा व्हिडिओ जनरेटर "world model" म्हणून काम करू शकत असेल—म्हणजेच वस्तू अवकाशात (space) कशा व्यापतात आणि वेळेनुसार कशा हालचाल करतात याचे प्रतिनिधित्व करणारा मॉडेल—तर व्हिज्युअल AI मधील पुढची मोठी झेप केवळ डेटासेट मोठे करण्याऐवजी generative capabilities वाढवण्यापासून येऊ शकते. एक सिंगल, prompt-driven मॉडेल उत्पादन पाइपलाइन्स सोपी करू शकते, इंजिनिअरिंगचा खर्च कमी करू शकते आणि अशा डेव्हलपर्ससाठी अडथळे कमी करू शकते ज्यांना vision फीचर्सची गरज आहे परंतु अनेक स्पेशलिस्ट नेटवर्क्स प्रशिक्षित करण्यासाठी संसाधने नाहीत.

मर्यादा आणि अनुत्तरित प्रश्न

कामगिरीचे आकडे synthetic data आणि बेंचमार्क सूट्समधून आले आहेत, जे कदाचित वास्तविक जगातील फुटेजमधील गुंतागुंत दर्शवणार नाहीत. अनियंत्रित प्रकाश (lighting), हवामान किंवा कॅमेरा हालचालींसाठी याचे सामान्यीकरण (generalisation) अद्याप सिद्ध झालेले नाही. ८१-फ्रेमच्या क्लिपसाठी दहा सेकंदाचा inference, जरी iterative diffusion पेक्षा वेगवान असला तरी, रोबोटिक्स किंवा AR साठी रिअल-टाइमच्या खूप जवळ नाही. शिवाय, मॉडेलचे १४-billion parameters तैनात करण्यासाठी मोठ्या प्रमाणात compute budget लागते, ज्यामुळे चांगल्या प्रकारे निधी असलेल्या लॅब्सबाहेर याची उपलब्धता मर्यादित होऊ शकते.

पुढे काय पाहायचे

  • Real-world validation: outdoor driving videos, handheld phone footage, किंवा industrial inspection scenes वर GenCeption ची चाचणी करणारे अभ्यास.
  • Model scaling: डेटा-कार्यक्षमता टिकवून ठेवत मोठे किंवा अधिक कार्यक्षमतेने प्रशिक्षित केलेले व्हर्जन latency मधील अंतर कमी करू शकतात का.
  • Integration pathways: क्लाउड प्रोव्हायडर्स किंवा edge-AI प्लॅटफॉर्म्स एखादे सिंगल API कसे देऊ शकतात जे textual task description स्वीकारते आणि योग्य व्हिज्युअल आउटपुट देते.
  • Alternative training sources: मजबूती (robustness) सुधारण्यासाठी synthetic क्लिप्सना थोड्या प्रमाणात वास्तविक व्हिडिओसह मिसळण्याचे प्रयत्न.

निष्कर्ष

GenCeption हे दर्शवते की व्हिडिओ-जनरेशन इंजिन हे मल्टी-टास्क व्हिजन फाऊंडेशन मॉडेल म्हणूनही काम करू शकते, जे पारंपारिक पद्धतींच्या तुलनेत कित्येक पटीने लहान डेटासेटमधून शिकताना अत्याधुनिक डेप्थ, नॉर्मल्स, पोझ आणि सेगमेंटेशन प्रदान करते. अनेक तज्ज्ञ नेटवर्कना (specialist networks) एका प्रॉम्प्ट-चालित प्रणालीमध्ये एकत्रित करणे हे याचे मुख्य वैशिष्ट्य आहे; आता याची पुढची कसोटी म्हणजे हे आश्वासन कृत्रिम प्रयोगशाळांमधून बाहेरच्या अनपेक्षित जगात यशस्वी ठरते की नाही.