Google announced that its Gemini family now supports an “agentic” video-analysis mode that can trim token usage by as much as 88 % on standard benchmarks, a shift that could make long-form video AI dramatically cheaper for developers.
این حالت جدید، رویکرد قدیمی فریمبهفریم (که معمولاً نمونهبرداری ثابتِ یک فریم در ثانیه بود) را با یک حلقه مدلمحور جایگزین میکند که تصمیم میگیرد کدام بخشهای ویدئو، با چه سرعتی و از طریق کدام مودالیته (فریمها، صدا یا متن پیادهشده) بررسی شوند. سیستم با فراخوانی تنها سیگنالهای مورد نیاز برای یک پرسوجوی خاص، حجم دادههای ارسالی به مدل زبانی را کاهش میدهد و در عین حال، رویدادهای زیر ثانیهای را که یک نمونهبرداری کلی ممکن بود از دست بدهد، شکار میکند.
از نمونهبرداری ثابت تا بینایی خودمختار
قابلیتهای ویدئویی پیشین Gemini توسعهدهندگان را مجبور میکرد تا از قبل یک نرخ نمونهبرداری انتخاب کنند. نرخ بالاتر به معنای توکنهای بیشتر و صورتحسابهای سنگینتر بود؛ نرخ پایینتر نیز خطر از دست رفتن برشهای سریع را به همراه داشت. نسخه عاملمحور (agentic) جدید که در حال حاضر برای Gemini 3.7 Flash، 3.6 Flash و 3.5 Flash-Lite در دسترس است، یک چرخه «فکر-عمل-مشاهده» را مستقیماً در API تعبیه میکند. ابتدا، مدل درباره وظیفه مورد نظر استدلال میکند. سپس، بخشی را برای بازرسی انتخاب میکند. در نهایت، فریمهای انتخابشده، قطعات صوتی یا بخشهایی از متن را مشاهده میکند. اگر بخشی امیدوارکننده به نظر برسد، مدل آن را در لحظه با جزئیات دقیقتری بازنمونهبرداری میکند.
این نمونهبرداری پویا به مدل اجازه میدهد تا در ساعتها فیلم (مانند یک سخنرانی کامل یا یک ضبط چند ساعته) بدون مصرف میلیونها توکن جستجو کند. بنچمارکهایی که پرسوجو از ویدئو در دنیای واقعی (1H-VideoQA) و وظایف گستردهتر درک ویدئو (LVBench) را شبیهسازی میکنند، نشان میدهند که همان پرسوجوها با تقریباً یکدهم بودجه توکن قبلی انجام میشوند و در عین حال دقت بالاتری ارائه میدهند.
چرا صرفهجویی در توکن اهمیت دارد
تعداد توکنها مستقیماً با صورتحسابهای API ترجمه میشود. برای توسعهدهندهای که در حال ساخت یک ابزار ویرایش ویدئوی خودکار است، پردازش یک ویدئوی ۹۰ دقیقهای با نرخ یک فریم در ثانیه میتواند دهها میلیون توکن تولید کند و هزینهها را به صدها دلار برای هر ساعت محتوا برساند. کاهش ۸۸ درصدی، این رقم را به چند ده دلار کاهش میدهد و تحلیل ویدئویی در مقیاس بزرگ را برای استارتاپها و تیمهای کوچکتر که قبلاً با هزینههای بازدارنده روبرو بودند، فراهم میکند.
مزیت هزینه همچنین مانع ورود به حوزه آزمایش و تجربه را کاهش میدهد. پیش از این، مهندسان کدهای سفارشی برای تشخیص لحظات کلیدی، استخراج کلیپهای مرتبط و بازگرداندن آنها به مدل مینوشتند. با گنجانده شدن بینایی عاملمحور در Gemini API، توسعهدهندگان تنها با تغییر تنظیمات پردازش به حالت «agentic» در Google AI Studio یا Gemini Enterprise Agent Platform، این قابلیت را فعال میکنند. گوگل نرخ توکن استاندارد Gemini را حفظ کرده است؛ هیچ هزینه اضافی برای این نمونهبرداری هوشمندتر دریافت نمیشود.
دقت بدون حدس و گمان
از آنجایی که مدل تصمیم میگیرد کجا را نگاه کند، میتواند رویدادهایی کوتاهتر از یک ثانیه را شناسایی کند؛ چیزی که یک نمونهبرداری ثابت ۱ فریم در ثانیه (1 FPS) ناگزیر از دست میداد. این دقت برای شمارش تکرارها در یک ویدئوی ورزشی، ردیابی یک شیء در یک صحنه شلوغ یا علامتگذاری ناهنجاریهای ناگهانی در تصاویر امنیتی اهمیت دارد. وقتی مدل یک بازه امیدوارکننده را شناسایی میکند، بهطور خودکار نرخ فریم را برای آن بخش افزایش میدهد و تنها در جاهایی که اهمیت دارد، دادههایی با دقت بالا ارائه میدهد.
همین مکانیسم قدرت بخشیدن به ویژگیهای کاربرپسند مانند «Ask YouTube» را فراهم میکند؛ جایی که کاربران در حین پخش ویدئو، سوالات بصری میپرسند و پاسخهایی دریافت میکنند که بر اساس محتوای بصری واقعی است. این ویژگی با محدود کردن میزان ویدئوی ارسالی به مدل، سریعتر و با هزینه کمتر پاسخ میدهد و تجربه کاربری را بدون قربانی کردن عمق تحلیل، بهبود میبخشد.
محدودیتهای احتمالی و موازنهها
رویکرد عاملمحور یک راهکار معجزهآسا نیست. مصرف توکن بهشدت کاهش مییابد، اما مدل همچنان حلقه داخلی خود را اجرا میکند که میتواند در مقایسه با یک گذر مستقیم روی فریمهای نمونهبرداریشده، باعث ایجاد تأخیر (latency) شود. توسعهدهندگانی که بر کاربردهای بلادرنگ (real-time) تمرکز دارند، ممکن است نیاز داشته باشند بین هزینههای کمتر توکن و زمان پردازش اضافی، تعادل برقرار کنند.
پیشبینیپذیری یکی دیگر از نگرانیها است. از آنجایی که مدل تصمیم میگیرد کدام بخشها را نمونهبرداری کند، تعداد دقیق توکنها برای یک ویدئوی مشخص میتواند در هر بار اجرا متفاوت باشد. تیمهایی که به بودجهبندی دقیق نیاز دارند، ممکن است لازم باشد سیستمهای نظارتی برای مصرف توکن، بهویژه در مراحل اولیه ادغام، ایجاد کنند.
در نهایت، این عرضه محدود به نسخههای Flash از Gemini است. پروژههایی که بر مدلهای قدیمیتر یا غیر Flash متکی هستند، تا زمانی که مهاجرت نکنند از این مزیت بهرهمند نخواهند شد، که این امر میتواند مستلزم تلاشهای توسعهای اضافی باشد.
آنچه باید در آینده زیر نظر داشت
- الگوهای پذیرش: گزارشهای اولیه از توسعهدهندگانی که از حالت عاملمحور (agentic mode) استفاده میکنند، مشخص خواهد کرد که آیا صرفهجویی در هزینهها در حوزههای آموزش، سرگرمی، نظارت و سایر زمینهها پابرجا میماند یا خیر.
- تعدیل قیمتگذاری: اگر تقاضا برای تحلیل ویدئویی با حجم بالا افزایش یابد، گوگل ممکن است قیمتگذاری توکنها را تغییر دهد یا طرحهای پلکانی اضافه کند.
- گسترش قابلیتها: گنجاندن همین حلقه استدلال در محصولات مصرفکننده بیشتر میتواند موارد استفاده جدیدی را آشکار کند و آگاهی گستردهتری نسبت به هوش مصنوعی ویدئویی با بهرهوری توکن بالا ایجاد نماید.
- تکامل بنچمارکها: با آزمایش توسط تیمهای بیشتر روی مجموعهدادههای دنیای واقعی، جامعه کاربری امتیازات 1H-VideoQA و LVBench را اصلاح خواهد کرد که پتانسیل کشف موارد خاصی (edge cases) را دارد که در آنها نمونهبرداری ایستا همچنان عملکرد بهتری نسبت به روش عاملمحور دارد.
خلاصه نهایی
تحلیل ویدئویی عاملمحور گوگل به توسعهدهندگان اجازه میدهد مصرف توکن را تا ۸۸٪ کاهش دهند و در عین حال به بینش زمانی دقیقتری دست یابند. هزینه این کار، افزایش اندک در پیچیدگی پردازش و تعداد متغیر توکنها است، اما برای بسیاری از کاربردهای ویدئویی طولانی، صرفهجویی در هزینه و سهولت در یکپارچهسازی بر این نگرانیها غلبه میکند. تیمهایی که در حال ساخت هوش مصنوعی ویدئو-محور هستند باید این حالت جدید را سریعاً ارزیابی کنند؛ اقتصادِ مقیاسپذیریِ درک ویدئویی ممکن است به تازگی تغییر کرده باشد.
