Google के Gemini Omni को, जिसे नए Google Vids इंटरफ़ेस के माध्यम से एक्सेस किया जाता है, एक व्यावहारिक लैब टेस्ट से गुज़ारा गया ताकि यह देखा जा सके कि क्या AI तीन लगातार वीडियो संपादन (edits) के बाद भी एक ही विषय-कूरियर (subject-courier) को स्थिर रख सकता है।

यह टेस्ट क्यों महत्वपूर्ण है

जनरेटिव वीडियो टूल्स यह वादा करते हैं कि कोई भी केवल एक टेक्स्ट कमांड के साथ बैकग्राउंड बदल सकता है, लाइटिंग जोड़ सकता है या इफेक्ट्स डाल सकता है। एक क्रिएटर के लिए यह वादा सरल है: एक रॉ क्लिप से शुरुआत करें, “रात में बारिश कराओ” टाइप करें, और एक पॉलिश किए हुए शॉर्ट वीडियो के साथ तैयार हो जाएं। अधिकांश उपयोगकर्ता “ड्रिफ्ट” (drift) की छिपी हुई लागत को नहीं देख पाते हैं—जैसे-जैसे AI प्रत्येक नए निर्देश की व्याख्या करता है, मूल विषय के स्वरूप, मुद्रा (pose) या गति में धीरे-धीरे होने वाला बदलाव। यदि दूसरे संपादन के बाद कूरियर का चेहरा सूक्ष्म रूप से बदल जाता है, तो अंतिम परिणाम अव्यवसायिक लगता है और इसमें महंगे मैनुअल क्लीन-अप की आवश्यकता हो सकती है।

प्रयोग

बेसलाइन क्लिप – एक व्यक्ति का स्टैटिक-कैमरा स्टूडियो शॉट, जिसने नेवी विंडब्रेकर पहना हुआ है, बाएं हाथ में एक छोटा कार्डबोर्ड बॉक्स पकड़ा हुआ है, और कैमरे की ओर दो कदम बढ़ा रहा है। लाइटिंग एकसमान थी, बैकग्राउंड सादा था, और गति सरल थी।

संपादन अनुक्रम (Edit sequence) – एक के बाद एक तीन संपादन लागू किए गए:

  1. बैकग्राउंड स्वैप – स्टूडियो को रात में बारिश वाली शहर की सड़क से बदलें।
  2. लाइटिंग टवीक – कूरियर के चारों ओर एक नीली रिम लाइट और दुकान की खिड़की से आती एक गर्म चमक जोड़ें।
  3. एटमॉस्फियर लेयर – हल्की बारिश की बूंदें और भाप की एक पतली परत डालें।

एक “डायरेक्ट कंट्रोल” रन में तीनों निर्देशों को एक ही प्रॉम्प्ट में जोड़ा गया, जिससे AI को एक ही बार में अंतिम क्लिप जेनरेट करने की अनुमति मिली।

निरंतरता (Consistency) को कैसे स्कोर किया गया

स्कोरकार्ड में बारह मानदंड शामिल थे, जिन्हें चार विषयों में बांटा गया था:

  • कैरेक्टर स्टेबिलिटी – चेहरा, बाल और कपड़े बिल्कुल समान रहते हैं।
  • सीन स्टेबिलिटी – कैमरा एंगल और विषय की स्थिति स्थिर रहती है।
  • एडिट प्रिसिजन – AI किसी अन्य चीज़ को बदले बिना निर्देश का पालन करता है।
  • टेम्पोरल क्वालिटी – गति के दौरान कोई फ्लिकर, वार्पिंग या जिटर (jitter) दिखाई नहीं देता।

प्रत्येक क्लिप का मूल्यांकन पहले फ्रेम, दो-कदम चलने के मध्य बिंदु और अंतिम फ्रेम पर किया गया। स्कोरिंग से एक स्पष्ट पैटर्न सामने आया।

आंकड़े क्या कहते हैं

जब संपादन एक के ऊपर एक (stacked) किए गए, तो स्कोरकार्ड का उपयोग करके AI का मूल्यांकन किया गया। सिंगल-प्रॉम्प्ट कंट्रोल को भी समान मूल्यांकन प्राप्त हुआ।

कौन जीतता है और कौन हारता है

वे स्टूडियो जो एक एकल, व्यापक प्रॉम्प्ट का उपयोग कर सकते हैं, उन्हें अधिक सुचारू वर्कफ़्लो मिलता है। जनरेटिव वीडियो सिस्टम के डेवलपर्स के सामने एक स्पष्ट इंजीनियरिंग बाधा है—क्रमिक परिवर्तनों (sequential transformations) के दौरान विषय का एक स्थिर लेटेंट रिप्रेजेंटेशन (latent representation) बनाए रखने की आवश्यकता।

प्रति-तर्क (Counter-argument)

कुछ उपयोगकर्ताओं का तर्क है कि क्रमिक संपादन (incremental editing) अधिक रचनात्मक नियंत्रण प्रदान करता है। एक समय में एक तत्व को समायोजित करके, वे आगे बढ़ने से पहले प्रत्येक लेयर को फाइन-ट्यून कर सकते हैं। टेस्ट से पता चलता है कि इस लचीलेपन की कीमत विजुअल फिडेलिटी (visual fidelity) के रूप में चुकानी पड़ती है। यदि कोई क्रिएटर सूक्ष्म नियंत्रण के लिए विषय में मामूली बदलाव स्वीकार कर लेता है, तो वर्तमान Gemini Omni वर्कफ़्लो अभी भी व्यवहार्य हो सकता है।

आगे क्या देखने की ज़रूरत है

  • मॉडल रिफाइनमेंट्स जो प्रॉम्प्ट्स के दौरान विषय के लेटेंट कोड को लॉक कर दें।
  • यूज़र-फीडबैक लूप्स जो क्रिएटर्स को 'ड्रिफ्ट' को फ्लैग करने और विषय को “री-एंकर” (re-anchor) करने का अनुरोध करने की अनुमति दें।

निष्कर्ष (Takeaway)

Gemini Omni एक बार में निर्देशों का पूरा सेट मिलने पर एक पॉलिश किया हुआ, मल्टी-एलिमेंट वीडियो बना सकता है, लेकिन जब संपादन एक के बाद एक (stacked) किए जाते हैं, तो इसकी विषय फिडेलिटी (subject fidelity) कम हो जाती है।