સંશોધકોએ GraphVid રજૂ કર્યું છે, જે એક વિડિયો-જનરેશન સિસ્ટમ છે જે અગાઉના મોડલ્સની સરખામણીમાં તેના Fréchet Inception Distance માં 39.9% અને Fréchet Video Distance માં 37.6% નો ઘટાડો કરે છે. વાસ્તવિકતા (realism) અને મોશન ફિડેલિટી (motion fidelity) માં થયેલો આ વધારો રોબોટિક્સ સિમ્યુલેટર્સ, ઓટોનોમસ-ડ્રાઇવિંગ ટ્રેનિંગ સૂટ્સ અથવા કોમ્પ્યુટર-જનરેટેડ એનિમેશન બનાવતા કોઈપણ વ્યક્તિ માટે મહત્વપૂર્ણ છે.
હાલની પદ્ધતિઓ શા માટે અપૂરતી છે
વર્તમાન કંટ્રોલેબલ વિડિયો જનરેટર્સ બે ઇનપુટ પર આધાર રાખે છે. ટેક્સ્ટ પ્રોમ્પ્ટ્સ અસ્પષ્ટ વર્ણન આપે છે પરંતુ તે કોઈ વસ્તુના ચોક્કસ માર્ગને (path) નક્કી કરી શકતા નથી. ટ્રેજેક્ટરી ટૂલ્સ વપરાશકર્તાઓને દરેક પાત્ર માટે પિક્સેલ-લેવલનો માર્ગ દોરવા માટે મજબૂર કરે છે, જે ત્યારે નિષ્ફળ જાય છે જ્યારે દ્રશ્યોમાં એકબીજા સાથે સંપર્ક કરતી અનેક વસ્તુઓ અથવા અવરોધો (occlusions) હોય છે. એન્જિનિયરો ઈચ્છિત ગતિ (motion) બનાવતા કરતાં ખોટા ટ્રેક સુધારવામાં વધુ સમય વિતાવે છે.
GraphVid નો ઇન્ટરેક્શન-ગ્રાફ અભિગમ
GraphVid હાથથી દોરેલા માર્ગોને બદલે હાઈ-લેવલ ઇન્ટરેક્શન ગ્રાફનો ઉપયોગ કરે છે. દરેક પિક્સેલને મેપ કરવાને બદલે, વપરાશકર્તા સંબંધો વ્યાખ્યાયિત કરે છે—"વસ્તુ A વસ્તુ B ની નજીક જાય છે", "વસ્તુ C વસ્તુ D ને અનુસરે છે", "વસ્તુ E વસ્તુ F સાથે અથડાય છે". મોડલ આ ગ્રાફને બ્લુપ્રિન્ટ તરીકે વાંચે છે અને સંબંધિત સંકેતોને સુસંગત ગતિ અને દેખાવમાં રૂપાંતરિત કરે છે. કાચા કોઓર્ડિનેટ્સને બદલે સેમેન્ટિક્સ (semantics) પર ધ્યાન કેન્દ્રિત કરીને, તે વસ્તુઓ એકબીજાની પાછળ અદ્રશ્ય થઈ જાય ત્યારે પણ તેના પર નજર રાખે છે.
ટીમે એક સમર્પિત ટ્રેનિંગ સેટ, GraphVid-Bench બનાવ્યો છે, જે વિડિયો ક્લિપ્સને સ્ટ્રક્ચર્ડ રિલેશનલ ડેટા સાથે જોડે છે. આ ડેટાસેટ મોડલને બતાવે છે કે વિવિધ ઇન્ટરેક્શન પેટર્ન હેઠળ અનેક વસ્તુઓ કેવી રીતે સાથે ચાલે છે, જે તેને એવું 'મોશન વોકેબ્યુલરી' આપે છે જેને તે ઇન્ફરન્સ સમયે ફરીથી જોડી શકે છે.
પ્રદર્શનમાં સુધારો
| મેટ્રિક (Metric) | અગાઉના મોડલ્સ | GraphVid |
|---|---|---|
| Fréchet Inception Distance (FID) | – | ↓ 39.9 % |
| Fréchet Video Distance (FVD) | – | ↓ 37.6 % |
| Peak Signal-to-Noise Ratio (PSNR) | 9.87 | 15.98 |
| Structural Similarity Index (SSIM) | 0.38 | 0.61 |
નીચા FID અને FVD સ્કોરનો અર્થ છે કે જનરેટ થયેલા વિડિયો વધુ વાસ્તવિક લાગે છે અને ફ્રેમ્સમાં ગતિ વધુ સ્મૂધ રહે છે. PSNR અને SSIM માં થયેલો વધારો વધુ સ્પષ્ટ ટેક્સચર અને બહેતર સ્ટ્રક્ચરલ પ્રિઝર્વેશન સૂચવે છે. આ આંકડાઓ દર્શાવે છે કે GraphVid નોંધપાત્ર રીતે વાસ્તવિક ફૂટેજની નજીકના વિડિયો બનાવે છે.
કાર્યક્ષમતા અને વ્યવહારુ પ્રભાવ
GraphVid અગાઉના અભિગમો કરતા ઓછા પેરામીટર્સ અને ઓછા ટ્રેનિંગ ડેટા સાથે આ પરિણામો પ્રાપ્ત કરે છે. મોડલ પિક્સેલ-લેવલની ડાયનેમિક્સને યાદ રાખવાને બદલે સીન સ્ટ્રક્ચર વિશે તર્ક કરે છે. AI એન્જિનિયરો માટે, વર્કફ્લો મહેનત માંગી લેતા પાથ ડ્રોઈંગથી બદલાઈને રિલેશનલ ડેટા ડિઝાઇન કરવા તરફ જાય છે—એક એવો ફેરફાર જે વસ્તુઓની સંખ્યા વધવાની સાથે કુદરતી રીતે સ્કેલ થાય છે.
સંભવિત લાભાર્થીઓમાં સામેલ છે:
- Robotics – સિમ્યુલેટેડ વાતાવરણ હવે મેન્યુઅલ ટ્રેજેક્ટરી સ્ક્રિપ્ટિંગ વગર વાસ્તવિક ઓબ્જેક્ટ ઇન્ટરેક્શન દર્શાવી શકે છે.
- Autonomous-driving – અનેક કાર, પદયાત્રીઓ અને સાયકલ સવારો ધરાવતા ટ્રાફિકના દ્રશ્યો હાઈ-લેવલ ઇન્ટરેક્શન નિયમોથી જનરેટ કરી શકાય છે, જે ડેટા-ઓગમેન્ટેશન પાઇપલાઇનને ઝડપી બનાવે છે.
- Animation – કલાકારો વાર્તાના સંબંધો પર ધ્યાન કેન્દ્રિત કરી શકે છે જ્યારે સિસ્ટમ પાયાના મોશન ફિઝિક્સને સંભાળે છે.
મુખ્ય વાત (Takeaway): ઓબ્જેક્ટ સંબંધોને પ્રાથમિક કંટ્રોલ સિગ્નલ તરીકે ગણીને, GraphVid વિડિયો જનરેશનને સર્જકો માટે વધુ ઇન્ટ્યુઇટિવ અને વાસ્તવિક દુનિયાની ગતિ પ્રત્યે વધુ વફાદાર બનાવે છે, જે કંટ્રોલેબલ સિન્થેસિસ માટે એક નવી દિશા સૂચવે છે.
