مدل Gemini Omni گوگل که از طریق رابط کاربری جدید Google Vids در دسترس است، تحت یک آزمایش عملی در آزمایشگاه قرار گرفت تا مشخص شود آیا این هوش مصنوعی می‌تواند یک سوژه (پیک) را پس از سه ویرایش متوالی ویدیو، ثابت و بدون تغییر نگه دارد یا خیر.

چرا این آزمایش اهمیت دارد

ابزارهای تولید ویدیو (Generative video) وعده می‌دهند که هر کسی می‌تواند تنها با یک دستور متنی، پس‌زمینه را تغییر دهد، نورپردازی اضافه کند یا جلوه‌های بصری اعمال کند. برای یک تولیدکننده محتوا، این وعده ساده است: با یک کلیپ خام شروع کنید، تایپ کنید «باران در شب ببارد» و در نهایت یک ویدیوی کوتاه و صیقل‌خورده تحویل بگیرید. اکثر کاربران از هزینه پنهان «انحراف» (drift) بی‌اطلاع هستند؛ یعنی از دست رفتن تدریجی ظاهر، فیگور یا حرکت سوژه اصلی در حالی که هوش مصنوعی هر دستور جدید را تفسیر می‌کند. اگر چهره پیک پس از ویرایش دوم تغییر جزئی کند، اثر نهایی غیرحرفه‌ای به نظر می‌رسد و ممکن است به اصلاحات دستی و پرهزینه نیاز داشته باشد.

آزمایش

کلیپ پایه – یک نمای استودیویی با دوربین ثابت از فردی که یک بادگیر سرمه‌ای پوشیده، یک جعبه مقوایی کوچک در دست چپ دارد و دو قدم به سمت دوربین برمی‌دارد. نورپردازی یکنواخت، پس‌زمینه ساده و حرکت نیز ساده بود.

توالی ویرایش‌ها – سه ویرایش به ترتیب اعمال شدند:

  1. تعویض پس‌زمینه – جایگزینی استودیو با یک خیابان بارانی در شهر در شب.
  2. اصلاح نورپردازی – اضافه کردن یک نور لبه‌ای (rim light) آبی دور پیک و یک درخشش گرم از پنجره یک مغازه.
  3. لایه اتمسفر – اضافه کردن قطرات باران سبک و لایه‌ای نازک از بخار.

یک اجرای «کنترل مستقیم» (direct control)، هر سه دستور را در یک پرامپت واحد ترکیب کرد و به هوش مصنوعی اجازه داد تا کلیپ نهایی را در یک مرحله تولید کند.

نحوه امتیازدهی به ثبات

امتیازدهی بر اساس دوازده معیار انجام شد که در چهار دسته گروه‌بندی شده بودند:

  • ثبات شخصیت – چهره، مو و لباس بدون تغییر باقی می‌مانند.
  • ثبات صحنه – زاویه دوربین و موقعیت سوژه ثابت می‌ماند.
  • دقت ویرایش – هوش مصنوعی دستور را بدون تغییر دادن سایر موارد اجرا می‌کند.
  • کیفیت زمانی – در طول حرکت، هیچ لرزش (flicker)، تغییر شکل (warping) یا پرش (jitter) مشاهده نمی‌شود.

هر کلیپ در فریم اول، نقطه میانیِ دو قدمِ حرکت و فریم نهایی مورد ارزیابی قرار گرفت. امتیازدهی الگوی مشخصی را نشان داد.

اعداد چه می‌گویند

زمانی که ویرایش‌ها به صورت پیاپی (روی هم) اعمال شدند، هوش مصنوعی با استفاده از کارت امتیاز ارزیابی شد. اجرای کنترل‌شده با پرامپت واحد نیز با همان روش ارزیابی شد.

چه کسی برنده و چه کسی بازنده است

استودیوهایی که توانایی استفاده از یک پرامپت واحد و جامع را دارند، از گردش کار روان‌تری بهره‌مند می‌شوند. توسعه‌دهندگان سیستم‌های تولید ویدیو با یک چالش مهندسی آشکار روبرو هستند: نیاز به حفظ یک نمایش پنهان (latent representation) پایدار از سوژه در طول تغییرات متوالی.

استدلال مخالف

برخی کاربران استدلال می‌کنند که ویرایش مرحله‌به‌مرحله، کنترل خلاقانه بیشتری فراهم می‌کند. آن‌ها با تنظیم هر عنصر به صورت جداگانه، می‌توانند هر لایه را پیش از رفتن به مرحله بعد، دقیق‌تر تنظیم کنند. اما این آزمایش نشان می‌دهد که این انعطاف‌پذیری به قیمت کاهش وفاداری بصری (visual fidelity) تمام می‌شود. اگر یک تولیدکننده محتوا تغییرات جزئی در سوژه را در ازای کنترل دقیق‌تر بپذیرد، گردش کار فعلی Gemini Omni همچنان می‌تواند قابل استفاده باشد.

آنچه باید در آینده منتظر آن باشیم

  • بهبود مدل‌ها که کد پنهان (latent code) سوژه را در طول پرامپت‌های مختلف ثابت نگه می‌دارند.
  • حلقه‌های بازخورد کاربر که به تولیدکنندگان اجازه می‌دهد انحراف (drift) را گزارش کرده و درخواست «بازگشت به حالت اولیه» (re-anchor) سوژه را بدهند.

نتیجه‌گیری

Gemini Omni می‌تواند زمانی که مجموعه‌ای کامل از دستورات را به صورت یکجا دریافت می‌کند، ویدیویی صیقل‌خورده و چندالمانه تولید کند، اما وقتی ویرایش‌ها به صورت پیاپی روی هم اعمال می‌شوند، وفاداری به سوژه کاهش می‌یابد.