مدل Gemini Omni گوگل که از طریق رابط کاربری جدید Google Vids در دسترس است، تحت یک آزمایش عملی در آزمایشگاه قرار گرفت تا مشخص شود آیا این هوش مصنوعی میتواند یک سوژه (پیک) را پس از سه ویرایش متوالی ویدیو، ثابت و بدون تغییر نگه دارد یا خیر.
چرا این آزمایش اهمیت دارد
ابزارهای تولید ویدیو (Generative video) وعده میدهند که هر کسی میتواند تنها با یک دستور متنی، پسزمینه را تغییر دهد، نورپردازی اضافه کند یا جلوههای بصری اعمال کند. برای یک تولیدکننده محتوا، این وعده ساده است: با یک کلیپ خام شروع کنید، تایپ کنید «باران در شب ببارد» و در نهایت یک ویدیوی کوتاه و صیقلخورده تحویل بگیرید. اکثر کاربران از هزینه پنهان «انحراف» (drift) بیاطلاع هستند؛ یعنی از دست رفتن تدریجی ظاهر، فیگور یا حرکت سوژه اصلی در حالی که هوش مصنوعی هر دستور جدید را تفسیر میکند. اگر چهره پیک پس از ویرایش دوم تغییر جزئی کند، اثر نهایی غیرحرفهای به نظر میرسد و ممکن است به اصلاحات دستی و پرهزینه نیاز داشته باشد.
آزمایش
کلیپ پایه – یک نمای استودیویی با دوربین ثابت از فردی که یک بادگیر سرمهای پوشیده، یک جعبه مقوایی کوچک در دست چپ دارد و دو قدم به سمت دوربین برمیدارد. نورپردازی یکنواخت، پسزمینه ساده و حرکت نیز ساده بود.
توالی ویرایشها – سه ویرایش به ترتیب اعمال شدند:
- تعویض پسزمینه – جایگزینی استودیو با یک خیابان بارانی در شهر در شب.
- اصلاح نورپردازی – اضافه کردن یک نور لبهای (rim light) آبی دور پیک و یک درخشش گرم از پنجره یک مغازه.
- لایه اتمسفر – اضافه کردن قطرات باران سبک و لایهای نازک از بخار.
یک اجرای «کنترل مستقیم» (direct control)، هر سه دستور را در یک پرامپت واحد ترکیب کرد و به هوش مصنوعی اجازه داد تا کلیپ نهایی را در یک مرحله تولید کند.
نحوه امتیازدهی به ثبات
امتیازدهی بر اساس دوازده معیار انجام شد که در چهار دسته گروهبندی شده بودند:
- ثبات شخصیت – چهره، مو و لباس بدون تغییر باقی میمانند.
- ثبات صحنه – زاویه دوربین و موقعیت سوژه ثابت میماند.
- دقت ویرایش – هوش مصنوعی دستور را بدون تغییر دادن سایر موارد اجرا میکند.
- کیفیت زمانی – در طول حرکت، هیچ لرزش (flicker)، تغییر شکل (warping) یا پرش (jitter) مشاهده نمیشود.
هر کلیپ در فریم اول، نقطه میانیِ دو قدمِ حرکت و فریم نهایی مورد ارزیابی قرار گرفت. امتیازدهی الگوی مشخصی را نشان داد.
اعداد چه میگویند
زمانی که ویرایشها به صورت پیاپی (روی هم) اعمال شدند، هوش مصنوعی با استفاده از کارت امتیاز ارزیابی شد. اجرای کنترلشده با پرامپت واحد نیز با همان روش ارزیابی شد.
چه کسی برنده و چه کسی بازنده است
استودیوهایی که توانایی استفاده از یک پرامپت واحد و جامع را دارند، از گردش کار روانتری بهرهمند میشوند. توسعهدهندگان سیستمهای تولید ویدیو با یک چالش مهندسی آشکار روبرو هستند: نیاز به حفظ یک نمایش پنهان (latent representation) پایدار از سوژه در طول تغییرات متوالی.
استدلال مخالف
برخی کاربران استدلال میکنند که ویرایش مرحلهبهمرحله، کنترل خلاقانه بیشتری فراهم میکند. آنها با تنظیم هر عنصر به صورت جداگانه، میتوانند هر لایه را پیش از رفتن به مرحله بعد، دقیقتر تنظیم کنند. اما این آزمایش نشان میدهد که این انعطافپذیری به قیمت کاهش وفاداری بصری (visual fidelity) تمام میشود. اگر یک تولیدکننده محتوا تغییرات جزئی در سوژه را در ازای کنترل دقیقتر بپذیرد، گردش کار فعلی Gemini Omni همچنان میتواند قابل استفاده باشد.
آنچه باید در آینده منتظر آن باشیم
- بهبود مدلها که کد پنهان (latent code) سوژه را در طول پرامپتهای مختلف ثابت نگه میدارند.
- حلقههای بازخورد کاربر که به تولیدکنندگان اجازه میدهد انحراف (drift) را گزارش کرده و درخواست «بازگشت به حالت اولیه» (re-anchor) سوژه را بدهند.
نتیجهگیری
Gemini Omni میتواند زمانی که مجموعهای کامل از دستورات را به صورت یکجا دریافت میکند، ویدیویی صیقلخورده و چندالمانه تولید کند، اما وقتی ویرایشها به صورت پیاپی روی هم اعمال میشوند، وفاداری به سوژه کاهش مییابد.
