Google ने घोषणा की है कि इसके Gemini परिवार में अब एक "agentic" वीडियो-विश्लेषण मोड (video-analysis mode) का समर्थन है, जो मानक बेंचमार्क पर टोकन उपयोग को 88% तक कम कर सकता है। यह एक ऐसा बदलाव है जो डेवलपर्स के लिए लंबे वीडियो वाले AI को नाटकीय रूप से सस्ता बना सकता है।

यह नया मोड पुराने फ्रेम-दर-फ्रेम दृष्टिकोण—जो आमतौर पर प्रति सेकंड एक स्थिर फ्रेम का नमूना (sample) होता था—को एक मॉडल-संचालित लूप (model-driven loop) से बदल देता है। यह लूप तय करता है कि वीडियो के किन हिस्सों की जांच करनी है, किस गति से करनी है, और किस माध्यम (फ्रेम, ऑडियो, या ट्रांसक्रिप्ट) के जरिए करनी है। किसी विशिष्ट क्वेरी के लिए केवल आवश्यक संकेतों (signals) को ही शामिल करके, यह सिस्टम भाषा मॉडल (language model) को भेजे जाने वाले डेटा को कम कर देता है, जबकि उन सब-सेकंड घटनाओं को भी पकड़ लेता है जिन्हें एक सामान्य नमूना मिस कर सकता था।

फिक्स्ड सैंपलिंग से स्वायत्त विजन (Autonomous Vision) तक

Gemini की पिछली वीडियो क्षमताओं में डेवलपर्स को पहले से ही सैंपलिंग रेट चुनना पड़ता था। उच्च दर का मतलब था अधिक टोकन और अधिक बिल; कम दर का मतलब था त्वरित कट्स (quick cuts) छूटने का जोखिम। नया एजेंटिक वेरिएंट, जो वर्तमान में Gemini 3.7 Flash, 3.6 Flash और 3.5 Flash-Lite के लिए उपलब्ध है, सीधे API में एक "think-act-observe" चक्र को शामिल करता है। सबसे पहले, मॉडल कार्य के बारे में तर्क (reasoning) करता है। इसके बाद, यह निरीक्षण के लिए एक सेगमेंट चुनता है। अंत में, यह चुने हुए फ्रेम, ऑडियो क्लिप या ट्रांसक्रिप्ट के अंशों का अवलोकन करता है। यदि कोई सेगमेंट आशाजनक लगता है, तो मॉडल उसे तुरंत अधिक सूक्ष्मता (finer granularity) के साथ फिर से सैंपल करता है।

यह डायनेमिक सैंपलिंग मॉडल को लाखों टोकन खर्च किए बिना घंटों के फुटेज—जैसे कि एक पूरा व्याख्यान या कई घंटों की रिकॉर्डिंग—में घूमने की अनुमति देती है। वास्तविक दुनिया के वीडियो-प्रश्न-उत्तर (1H-VideoQA) और व्यापक वीडियो-समझ कार्यों (LVBench) की नकल करने वाले बेंचमार्क दिखाते हैं कि समान क्वेरी लगभग दसवें हिस्से (one-tenth) के टोकन बजट के साथ पूरी हो रही हैं और साथ ही उच्च सटीकता भी प्रदान कर रही हैं।

टोकन बचत क्यों महत्वपूर्ण है

टोकन की संख्या सीधे API बिलों में बदल जाती है। एक स्वचालित वीडियो-संपादन टूल बनाने वाले डेवलपर के लिए, प्रति सेकंड एक फ्रेम की दर से प्रोसेस किया गया 90 मिनट का वीडियो करोड़ों टोकन उत्पन्न कर सकता है, जिससे लागत सामग्री के प्रति घंटे सैकड़ों डॉलर तक पहुँच सकती है। 88% की कमी इस आंकड़े को कुछ दहाई डॉलर (tens of dollars) तक ले आती है, जिससे बड़े पैमाने पर वीडियो विश्लेषण उन स्टार्टअप्स और छोटी टीमों के लिए सुलभ हो जाता है जो पहले अत्यधिक बिलों का सामना करते थे।

लागत का यह लाभ प्रयोग करने की बाधा को भी कम करता है। पहले, इंजीनियरों को प्रमुख क्षणों का पता लगाने, प्रासंगिक क्लिप निकालने और उन्हें वापस मॉडल में फीड करने के लिए कस्टम कोड लिखना पड़ता था। Gemini API में एजेंटिक विजन शामिल होने के साथ, डेवलपर्स Google AI Studio या Gemini Enterprise Agent Platform में प्रोसेसिंग कॉन्फ़िगरेशन को "agentic" पर टॉगल करके इस फीचर को सक्षम कर सकते हैं। Google मानक Gemini टोकन दर बनाए रखता है; स्मार्ट सैंपलिंग के लिए कोई अतिरिक्त शुल्क नहीं है।

बिना किसी अनुमान के सटीकता

क्योंकि मॉडल तय करता है कि कहाँ देखना है, इसलिए यह एक सेकंड से कम की घटनाओं को भी पहचान सकता है—ऐसी चीज़ जिसे एक स्थिर 1 FPS सैंपल निश्चित रूप से मिस कर देता। यह सटीकता वर्कआउट वीडियो में दोहराव (repetitions) गिनने, भीड़भाड़ वाले दृश्य में किसी वस्तु को ट्रैक करने, या सुरक्षा फुटेज में अचानक विसंगतियों (anomalies) को चिह्नित करने के लिए महत्वपूर्ण है। जब मॉडल एक आशाजनक विंडो को चिह्नित करता है, तो यह स्वचालित रूप से उस हिस्से के लिए फ्रेम-रेट बढ़ा देता है, जिससे केवल वहीं उच्च-सटीकता वाला डेटा मिलता है जहाँ इसकी आवश्यकता होती है।

यही तंत्र "Ask YouTube" जैसे उपभोक्ता-केंद्रित फीचर्स को शक्ति प्रदान करता है, जहाँ उपयोगकर्ता वीडियो चलते समय दृश्य प्रश्न पूछते हैं और वास्तविक दृश्य सामग्री पर आधारित उत्तर प्राप्त करते हैं। मॉडल को भेजे जाने वाले वीडियो की मात्रा को सीमित करके, यह फीचर कम लागत पर तेज़ी से प्रतिक्रिया देता है, जिससे गहराई से समझौता किए बिना उपयोगकर्ता अनुभव में सुधार होता है।

संभावित सीमाएँ और समझौते (Trade-offs)

एजेंटिक दृष्टिकोण कोई रामबाण (silver bullet) नहीं है। टोकन का उपयोग नाटकीय रूप से कम हो जाता है, लेकिन मॉडल अभी भी अपना आंतरिक लूप चलाता है, जो प्री-सैंपल किए गए फ्रेमों पर सीधे पास की तुलना में लेटेंसी (latency) बढ़ा सकता है। रीयल-टाइम एप्लिकेशन पर ध्यान केंद्रित करने वाले डेवलपर्स को कम टोकन लागत और अतिरिक्त प्रोसेसिंग समय के बीच संतुलन बनाने की आवश्यकता हो सकती है।

पूर्वानुमान (Predictability) एक अन्य चिंता है। क्योंकि मॉडल तय करता है कि किन सेगमेंट को सैंपल करना है, इसलिए किसी दिए गए वीडियो के लिए सटीक टोकन संख्या हर बार अलग हो सकती है। जिन टीमों को सख्त बजट की आवश्यकता होती है, उन्हें विशेष रूप से शुरुआती एकीकरण (integration) के दौरान टोकन खपत के आसपास निगरानी (monitoring) तंत्र बनाने की आवश्यकता हो सकती है।

अंत में, यह रोलआउट Gemini के Flash वेरिएंट तक ही सीमित है। जो प्रोजेक्ट पुराने या नॉन-फ्लैश मॉडल पर निर्भर हैं, उन्हें माइग्रेट करने तक इसका लाभ नहीं मिलेगा, जिसमें अतिरिक्त विकास प्रयास शामिल हो सकते हैं।

आगे क्या देखने को मिलेगा

  • अपनाए जाने के पैटर्न: एजेंटिक मोड का उपयोग करने वाले डेवलपर्स की शुरुआती रिपोर्टें यह बताएंगी कि क्या शिक्षा, मनोरंजन, निगरानी और अन्य क्षेत्रों में लागत की बचत बनी रहती है।
  • मूल्य निर्धारण में समायोजन: यदि उच्च-मात्रा वाले वीडियो विश्लेषण की मांग में उछाल आता है, तो गूगल टोकन मूल्य निर्धारण में बदलाव कर सकता है या टियर वाले प्लान जोड़ सकता है।
  • फीचर विस्तार: इसी रीजनिंग लूप को अधिक उपभोक्ता उत्पादों में शामिल करने से नए उपयोग के मामले सामने आ सकते हैं और टोकन-कुशल वीडियो AI के बारे में व्यापक जागरूकता बढ़ सकती है।
  • बेंचमार्क का विकास: जैसे-जैसे अधिक टीमें वास्तविक दुनिया के डेटासेट पर परीक्षण करेंगी, समुदाय 1H-VideoQA और LVBench स्कोर को और बेहतर बनाएगा, जिससे संभावित रूप से ऐसे एज केस (edge cases) सामने आ सकते हैं जहाँ स्टैटिक सैंपलिंग अभी भी एजेंटिक पद्धति से बेहतर प्रदर्शन करती है।

निष्कर्ष

गूगल का एजेंटिक वीडियो विश्लेषण डेवलपर्स को समय संबंधी बेहतर जानकारी (temporal insight) प्राप्त करने के साथ-साथ टोकन की खपत में 88% तक की कटौती करने की सुविधा देता है। इसके बदले में प्रोसेसिंग की जटिलता और परिवर्तनीय टोकन गणना में मामूली वृद्धि होती है, लेकिन कई लॉन्ग-फॉर्म वीडियो अनुप्रयोगों के लिए, लागत में बचत और एकीकरण की आसानी इन चिंताओं से कहीं अधिक महत्वपूर्ण है। वीडियो-केंद्रित AI बनाने वाली टीमों को इस नए मोड का तेजी से मूल्यांकन करना चाहिए; वीडियो समझ (video understanding) को स्केल करने के अर्थशास्त्र में अभी-अभी बदलाव आया हो सकता है।