નવા Google Vids ઇન્ટરફેસ દ્વારા એક્સેસ કરી શકાય તેવા Google Gemini Omni નું પ્રાયોગિક લેબ ટેસ્ટ કરવામાં આવ્યું હતું, જેથી એ જોઈ શકાય કે શું AI સતત ત્રણ વીડિયો એડિટિંગ પછી પણ એક જ વિષય-કુરિયર (subject-courier) ને સ્થિર રાખી શકે છે.
આ ટેસ્ટ શા માટે મહત્વપૂર્ણ છે
જનરેટિવ વીડિયો ટૂલ્સ એવો વાયદો કરે છે કે કોઈપણ વ્યક્તિ માત્ર એક ટેક્સ્ટ કમાન્ડ દ્વારા બેકગ્રાઉન્ડ બદલી શકે છે, લાઇટિંગ ઉમેરી શકે છે અથવા ઇફેક્ટ્સ ઉમેરી શકે છે. ક્રિએટર માટે આ વચન સરળ છે: એક કાચા (raw) ક્લિપથી શરૂઆત કરો, “make it rain at night” ટાઇપ કરો, અને એક તૈયાર શોર્ટ વીડિયો મેળવો. મોટાભાગના વપરાશકર્તાઓ "ડ્રિફ્ટ" (drift) ની છુપી કિંમત જોતા નથી—જેમ કે AI દરેક નવા નિર્દેશનું અર્થઘટન કરતી વખતે મૂળ વિષયના દેખાવ, પોઝ અથવા હલનચલનમાં ધીમે ધીમે થતો ફેરફાર. જો બીજા એડિટ પછી કુરિયરનો ચહેરો સહેજ પણ બદલાઈ જાય, તો અંતિમ વીડિયો બિનવ્યાવસાયિક લાગે છે અને તેને ખર્ચાળ મેન્યુઅલ ક્લીન-અપની જરૂર પડી શકે છે.
પ્રયોગ
બેઝલાઇન ક્લિપ (Baseline clip) – નેવી બ્લુ વિન્ડબ્રેકર પહેરેલી એક વ્યક્તિનો સ્ટેટિક-કેમેરા સ્ટુડિયો શૉટ, જેણે ડાબા હાથમાં નાનું કાર્ડબોર્ડ બોક્સ પકડ્યું છે અને કેમેરા તરફ બે ડગલાં ભરી રહ્યું છે. લાઇટિંગ સમાન હતી, બેકગ્રાઉન્ડ સાદું હતું અને હલનચલન સરળ હતું.
એડિટ સિક્વન્સ (Edit sequence) – એક પછી એક ત્રણ એડિટ્સ લાગુ કરવામાં આવ્યા હતા:
- બેકગ્રાઉન્ડ સ્વેપ (Background swap) – સ્ટુડિયોને બદલે રાત્રિના સમયે વરસાદી શહેરની શેરી મૂકો.
- લાઇટિંગ ટ્વીક (Lighting tweak) – કુરિયરની આસપાસ બ્લુ રિમ લાઇટ અને દુકાનની બારીમાંથી આવતો હૂંફાળો પ્રકાશ ઉમેરો.
- એટમોસ્ફિયર લેયર (Atmosphere layer) – હળવા વરસાદના ટીપાં અને વરાળનું પાતળું પડ ઉમેરો.
એક “ડાયરેક્ટ કંટ્રોલ” (direct control) રન દ્વારા ત્રણેય સૂચનાઓને એક જ પ્રોમ્પ્ટમાં જોડવામાં આવી હતી, જેનાથી AI એક જ વારમાં અંતિમ ક્લિપ જનરેટ કરી શક્યું.
સુસંગતતા કેવી રીતે માપવામાં આવી
સ્કોરકાર્ડમાં બાર માપદંડો હતા, જેને ચાર વિષયોમાં વહેંચવામાં આવ્યા હતા:
- પાત્રની સ્થિરતા (Character stability) – ચહેરો, વાળ અને કપડાં સમાન રહે છે.
- દ્રશ્યની સ્થિરતા (Scene stability) – કેમેરા એંગલ અને વિષયનું સ્થાન સ્થિર રહે છે.
- એડિટની ચોકસાઈ (Edit precision) – AI અન્ય કોઈ પણ વસ્તુ બદલ્યા વિના સૂચનાનું પાલન કરે છે.
- કાલનિક ગુણવત્તા (Temporal quality) – હલનચલન દરમિયાન કોઈ ફ્લિકર (flicker), વિકૃતિ (warping) અથવા જિટર (jitter) દેખાતું નથી.
દરેક ક્લિપનું મૂલ્યાંકન પ્રથમ ફ્રેમ, બે ડગલાં ચાલવાના મધ્ય બિંદુ અને અંતિમ ફ્રેમ પર કરવામાં આવ્યું હતું. સ્કોરિંગથી એક સ્પષ્ટ પેટર્ન જોવા મળી હતી.
આંકડા શું કહે છે
જ્યારે એડિટ્સ એક પછી એક કરવામાં આવ્યા (stacked), ત્યારે સ્કોરકાર્ડનો ઉપયોગ કરીને AI નું મૂલ્યાંકન કરવામાં આવ્યું હતું. સિંગલ-પ્રોમ્પ્ટ કંટ્રોલને પણ સમાન મૂલ્યાંકન મળ્યું હતું.
કોણ જીતે છે અને કોણ હારે છે
જે સ્ટુડિયો એક જ વ્યાપક પ્રોમ્પ્ટનો ઉપયોગ કરી શકે છે તેમને વધુ સરળ વર્કફ્લો મળે છે. જનરેટિવ વીડિયો સિસ્ટમના ડેવલપર્સ સામે એક સ્પષ્ટ એન્જિનિયરિંગ અવરોધ છે—ક્રમિક પરિવર્તનો દરમિયાન વિષયનું સ્થિર લેટન્ટ રિપ્રેઝન્ટેશન (latent representation) જાળવી રાખવાની જરૂરિયાત.
વિરોધ પક્ષનો તર્ક
કેટલાક વપરાશકર્તાઓ દલીલ કરે છે કે ઇન્ક્રીમેન્ટલ એડિટિંગ (ક્રમિક એડિટિંગ) વધુ સર્જનાત્મક નિયંત્રણ આપે છે. એક સમયે એક તત્વને એડજસ્ટ કરીને, તેઓ આગળ વધતા પહેલા દરેક લેયરને ફાઇન-ટ્યુન કરી શકે છે. ટેસ્ટ દર્શાવે છે કે આ લવચીકતા વિઝ્યુઅલ ફિડેલિટી (visual fidelity) ની કિંમત પર આવે છે. જો કોઈ ક્રિએટર ઝીણવટભર્યા નિયંત્રણ માટે વિષયમાં નાના ફેરફારો સ્વીકારે છે, તો વર્તમાન Gemini Omni વર્કફ્લો હજુ પણ વ્યવહારુ હોઈ શકે છે.
આગળ શું જોવા જેવું છે
- મોડેલ રિફાઇનમેન્ટ્સ (Model refinements) જે પ્રોમ્પ્ટ્સમાં વિષયના લેટન્ટ કોડને લોક કરે છે.
- યુઝર-ફીડબેક લૂપ્સ (User-feedback loops) જે ક્રિએટર્સને ડ્રિફ્ટને ફ્લેગ કરવાની અને વિષયને “રી-એન્કર” (re-anchor) કરવાની વિનંતી કરવાની મંજૂરી આપે છે.
મુખ્ય તારણ
Gemini Omni જ્યારે એકસાથે સૂચનાઓનો સંપૂર્ણ સેટ આપવામાં આવે ત્યારે એક પોલિશ્ડ, મલ્ટી-એલિમેન્ટ વીડિયો બનાવી શકે છે, પરંતુ જ્યારે એડિટ્સ એક પછી એક કરવામાં આવે ત્યારે તેની વિષયની સચોટતા (subject fidelity) ઘટે છે.
