Google DeepMind એ GenCeption ની જાહેરાત કરી છે, જે એક એવું મોડેલ છે જે ટેક્સ્ટ-ટુ-વિડિયો જનરેટરને માત્ર 7,500 સિન્થેટિક વિડિયોનો ઉપયોગ કરીને વિવિધ વિઝન કાર્યો માટે સિંગલ ફાઉન્ડેશન મોડેલમાં ફેરવે છે. તેનો દાવો સરળ છે: એક વિડિયો જનરેટર જે પહેલેથી જ જાણે છે કે વસ્તુઓ કેવી રીતે ગતિ કરે છે અને એકબીજા સાથે કેવી રીતે સંપર્ક કરે છે, તેને દરેક માટે અલગ નેટવર્ક બનાવ્યા વિના ડેપ્થ (depth), સરફેસ નોર્મલ્સ (surface normals), સેગમેન્ટેશન માસ્ક (segmentation masks) અને 3D પોઝ (3D pose) ની આગાહી કરવા માટે ફરીથી ઉપયોગમાં લઈ શકાય છે.

વિખરાયેલી વિઝન પાઇપલાઇન્સથી એકીકૃત મોડેલ સુધી

લાર્જ લેંગ્વેજ મોડેલ્સ આગામી શબ્દની આગાહી કરવાનું શીખીને બહુમુખી બન્યા છે. તેનાથી વિપરીત, કોમ્પ્યુટર-વિઝન સંશોધન હજુ પણ સ્પેશિયાલિસ્ટ સિસ્ટમ્સ સાથે સંઘર્ષ કરી રહ્યું છે—સેગમેન્ટેશન માટે એક, ડેપ્થ માટે બીજી અને પોઝ માટે ત્રીજી. GenCeption આ પચાસી (patchwork) ને ટાળે છે. એક ટેક્સ્ટ પ્રોમ્પ્ટ મોડેલને જણાવે છે કે કયો આઉટપુટ આપવાનો છે, અને તે જ 14-બિલિયન-પેરામીટર આર્કિટેક્ચર ડેપ્થ મેપ્સ, નોર્મલ મેપ્સ, સેગમેન્ટેશન માસ્ક અથવા કીપોઈન્ટ પ્રિડિક્શન આપે છે. દરેક આઉટપુટને સ્ટાન્ડર્ડ થ્રી-ચેનલ RGB ઇમેજ તરીકે ગણીને, સિસ્ટમ પાઇપલાઇનને એકસમાન રાખે છે; જે કાર્યો કુદરતી રીતે ઇમેજ ઉત્પન્ન કરતા નથી, તેના માટે સંશોધકોએ નાના ટ્રેનેબલ મોડ્યુલ્સ ઉમેર્યા છે.

એક નાના સિન્થેટિક કોર્પસ પર તાલીમ

ટીમે Blender માં એક સિન્થેટિક ડેટાસેટ બનાવ્યો, જેમાં 200 મોશન-કેપ્ચર સિક્વન્સ દ્વારા સંચાલિત 800 ડિજિટલ હ્યુમન મોડેલ્સમાંથી 7,500 ટૂંકા વિડિયો રેન્ડર કરવામાં આવ્યા હતા. D4RT અથવા VGGT Omega જેવા પરંપરાગત વિડિયો-જનરેશન મોડેલ્સ લાખો ક્લિપ્સ પર તાલીમ લે છે; GenCeption તે ડેટાના સાતમા ભાગથી લઈને પાંચસોમા ભાગ જેટલો ડેટા વાપરીને સમાન અથવા વધુ સારું પ્રદર્શન હાંસલ કરે છે. અહેવાલ મુજબના બેન્ચમાર્ક આ મુજબ છે:

  • DepthAnything 3 જેવા વિશિષ્ટ મોડેલ્સની સમકક્ષ ડેપ્થ એસ્ટીમેશન (Depth estimation).
  • NormalCrafter અને Lotus-2 કરતા વધુ સારું સરફેસ-નોર્મલ પ્રિડિક્શન (Surface-normal prediction).
  • Genmo અને TRAM કરતા આગળ નીકળતું 3D પોઝ રેકગ્નિશન (3D pose recognition).
  • Meta ના SAM 3 અને Gemini 3.5 Flash ની સંયુક્ત શક્તિ સાથે મેળ ખાતું લેંગ્વેજ-ગાઇડેડ સેગમેન્ટેશન (Language-guided segmentation).

લેખકો કહે છે કે જનરેટિવ ઓબ્જેક્ટિવ નેટવર્કને સીન જીઓમેટ્રી (scene geometry) અને ફિઝિક્સને આંતરિક રીતે સમજવા માટે મજબૂર કરે છે, જે પછી ડાઉનસ્ટ્રીમ પરસેપ્શન કાર્યોમાં ટ્રાન્સફર થાય છે.

ઝડપ માટે આર્કિટેક્ચરલ શોર્ટકટ્સ

GenCeption Alibaba ના ઓપન-સોર્સ Wan2.1 વિડિયો મોડેલ પર આધારિત છે. ઘણા ઇટરેશનમાં ફ્રેમ્સને રિફાઇન કરતી સામાન્ય ડિફ્યુઝન પ્રક્રિયાને બદલે, સંશોધકોએ સિસ્ટમને સિંગલ ફોરવર્ડ પાસમાં પ્રિડિક્શન આપવા માટે ફરીથી એન્જિનિયર કરી છે. પરિણામ: મોડેલ વર્તમાન હાર્ડવેર પર આશરે દસ સેકન્ડમાં 81-ફ્રેમ ક્લિપ પ્રોસેસ કરે છે. 14-બિલિયન-પેરામીટરનું કદ મોટું રહે છે, પરંતુ તાલીમમાં થતી બચત અને મલ્ટિપલ ટાસ્ક-સ્પેસિફિક નેટવર્ક્સની જરૂરિયાત દૂર થવાથી નોંધપાત્ર કાર્યક્ષમતા મળે છે.

AI સમુદાયે શા માટે ધ્યાન આપવું જોઈએ

જો એક વિડિયો જનરેટર 'વર્લ્ડ મોડેલ' (world model) તરીકે કામ કરી શકે—એક એવું પ્રતિનિધિત્વ જે વસ્તુઓ અવકાશમાં કેવી રીતે રોકાય છે અને સમય જતાં કેવી રીતે ગતિ કરે છે તે કેપ્ચર કરે છે—તો વિઝ્યુઅલ AI માં આગામી મોટી છલાંગ વધુ મોટા ડેટાસેટ્સના એનોટેશનને બદલે જનરેટિવ ક્ષમતાઓના સ્કેલિંગમાંથી આવી શકે છે. એક સિંગલ, પ્રોમ્પ્ટ-ડ્રિવન મોડેલ પ્રોડક્ટ પાઇપલાઇન્સને સરળ બનાવી શકે છે, એન્જિનિયરિંગ ખર્ચ ઘટાડી શકે છે, અને એવા ડેવલપર્સ માટે અવરોધ ઘટાડી શકે છે જેમને વિઝન ફીચર્સની જરૂર છે પરંતુ મલ્ટિપલ સ્પેશિયાલિસ્ટ નેટવર્ક્સ તાલીમ આપવા માટે સંસાધનોનો અભાવ છે.

સાવચેતીઓ અને વણઉત્તરિત પ્રશ્નો

પરફોર્મન્સના આંકડા સિન્થેટિક ડેટા અને બેન્ચમાર્ક સ્યુટ્સમાંથી આવે છે જે વાસ્તવિક દુનિયાના ફૂટેજની જટિલતાને પ્રતિબિંબિત ન પણ કરે. અનિયંત્રિત લાઇટિંગ, હવામાન અથવા કેમેરાના હલનચલન માટેનું જનરલાઇઝેશન હજુ અપ્રમાણિત છે. 81-ફ્રેમ ક્લિપ માટે દસ સેકન્ડનું ઇન્ફરન્સ (inference), ઇટરેટિવ ડિફ્યુઝન કરતા ઝડપી હોવા છતાં, રોબોટિક્સ અથવા AR માટે હજુ પણ રિયલ-ટાઇમથી ઘણું દૂર છે. વધુમાં, મોડેલના 14-બિલિયન પેરામીટર્સ ડિપ્લોયમેન્ટ માટે નોંધપાત્ર કમ્પ્યુટ બજેટની માંગ કરે છે, જે સારી રીતે ફંડ મેળવેલી લેબ્સ સિવાયની સુલભતાને મર્યાદિત કરી શકે છે.

આગળ શું જોવું

  • રિયલ-વર્લ્ડ વેલિડેશન: અભ્યાસો જે GenCeption ને આઉટડોર ડ્રાઇવિંગ વિડિયો, હેન્ડહેલ્ડ ફોન ફૂટેજ અથવા ઇન્ડસ્ટ્રિયલ ઇન્સ્પેક્શન સીન પર ટેસ્ટ કરે છે.
  • મોડેલ સ્કેલિંગ: શું મોટા અથવા વધુ કાર્યક્ષમ રીતે તાલીમ પામેલા વર્ઝન ડેટા-એફિશિયન્સી જાળવી રાખીને લેટન્સી ગેપ (latency gap) ઘટાડી શકે છે.
  • ઇન્ટિગ્રેશન પાથવેઝ: ક્લાઉડ પ્રોવાઇડર્સ અથવા એજ-AI પ્લેટફોર્મ્સ કેવી રીતે એક સિંગલ API પ્રદાન કરી શકે છે જે ટેક્સ્ટ્યુઅલ ટાસ્ક ડિસ્ક્રિપ્શન સ્વીકારે છે અને યોગ્ય વિઝ્યુઅલ આઉટપુટ આપે છે.
  • વૈકલ્પિક તાલીમ સ્ત્રોતો: મજબૂતી વધારવા માટે સિન્થેટિક ક્લિપ્સને મર્યાદિત પ્રમાણમાં વાસ્તવિક વિડિયો સાથે મિશ્રિત કરવાના પ્રયાસો.

Takeaway

GenCeption દર્શાવે છે કે વિડિયો-જનરેશન એન્જિન એક મલ્ટી-ટાસ્ક વિઝન ફાઉન્ડેશન મોડેલ તરીકે પણ કામ કરી શકે છે, જે પરંપરાગત અભિગમો કરતા અનેકગણા નાની ડેટાસેટમાંથી શીખતી વખતે અત્યાધુનિક ડેપ્થ, નોર્મલ્સ, પોઝ અને સેગ્મેન્ટેશન પ્રદાન કરે છે. તેનું વચન અનેક નિષ્ણાત નેટવર્ક્સને એક પ્રોમ્પ્ટ-ડ્રિવન સિસ્ટમમાં એકીકૃત કરવામાં રહેલું છે; તેની આગામી કસોટી એ હશે કે શું તે વચન કૃત્રિમ લેબ્સમાંથી બહારની અનિશ્ચિત દુનિયામાં પ્રવેશતી વખતે ટકી રહેશે કે નહીં.