خضع نموذج Gemini Omni من Google، والذي يمكن الوصول إليه عبر واجهة Google Vids الجديدة، لاختبار معملي عملي لمعرفة ما إذا كان بإمكان الذكاء الاصطناعي الحفاظ على استقرار شخصية "عامل التوصيل" بعد ثلاث عمليات تحرير متتالية للفيديو.
لماذا يكتسب هذا الاختبار أهمية
تَعِد أدوات الفيديو التوليدية أي شخص بإمكانية تبديل الخلفيات، أو إضافة الإضاءة، أو نثر التأثيرات بأمر نصي واحد. وبالنسبة لصانع المحتوى، فإن الوعد بسيط: ابدأ بمقطع خام، واكتب "اجعل المطر يهطل ليلاً"، واحصل على مقطع قصير مصقول. لكن معظم المستخدمين لا يدركون التكلفة الخفية لـ "الانحراف" (drift) — وهو الفقدان التدريجي لمظهر الشخصية الأصلية أو وضعيتها أو حركتها مع تفسير الذكاء الاصطناعي لكل تعليمات جديدة. فإذا تغير وجه عامل التوصيل بشكل طفيف بعد التعديل الثاني، سيبدو العمل النهائي غير احترافي وقد يتطلب عملية تنظيف يدوي مكلفة.
التجربة
المقطع الأساسي – لقطة استوديو بكاميرا ثابتة لشخص يرتدي سترة واقية من الرياح بلون كحلي، ويمسك بصندوق كرتوني صغير في يده اليسرى، ويخطو خطوتين نحو الكاميرا. كانت الإضاءة متساوية، والخلفية بسيطة، والحركة سهلة.
تسلسل التعديلات – تم تطبيق ثلاثة تعديلات بالتتابع:
- تبديل الخلفية – استبدال الاستوديو بشارع مدينة ممطر ليلاً.
- تعديل الإضاءة – إضافة إضاءة حواف زرقاء حول عامل التوصيل وتوهج دافئ من نافذة متجر.
- طبقة الأجواء – نثر قطرات مطر خفيفة وستار رقيق من البخار.
أما تجربة "التحكم المباشر" فقد جمعت التعليمات الثلاث في أمر نصي واحد، مما سمح للذكاء الاصطناعي بتوليد المقطع النهائي دفعة واحدة.
كيف تم تقييم الاتساق
شكلت اثنا عشر معياراً بطاقة التقييم، مقسمة إلى أربعة محاور:
- استقرار الشخصية – بقاء الوجه والشعر والملابس متطابقة.
- استقرار المشهد – بقاء زاوية الكاميرا وموضع الشخصية ثابتين.
- دقة التعديل – اتباع الذكاء الاصطناعي للتعليمات دون تغيير أي شيء آخر.
- الجودة الزمنية – عدم ظهور أي وميض أو تشوه أو اهتزاز أثناء الحركة.
تم تقييم كل مقطع عند الإطار الأول، ومنتصف الخطوتين، والإطار النهائي. وكشف التقييم عن نمط واضح.
ماذا تقول الأرقام
عندما تم تكديس التعديلات، تم تقييم الذكاء الاصطناعي باستخدام بطاقة التقييم. وحصلت تجربة التحكم عبر الأمر النصي الواحد على التقييم نفسه.
من الرابح ومن الخاسر
تستفيد الاستوديوهات التي يمكنها استخدام أمر نصي واحد وشامل من سير عمل أكثر سلاسة. أما مطورو أنظمة الفيديو التوليدية فيواجهون عقبة هندسية واضحة — وهي الحاجة إلى الحفاظ على تمثيل كامن (latent representation) مستقر للشخصية عبر التحولات المتتالية.
وجهة النظر المعارضة
يجادل بعض المستخدمين بأن التعديل التدريجي يوفر تحكماً إبداعياً أكبر. فمن خلال ضبط عنصر واحد في كل مرة، يمكنهم ضبط كل طبقة بدقة قبل الانتقال إلى التالية. لكن الاختبار يظهر أن هذه المرونة تأتي على حساب الدقة البصرية. وإذا قبل صانع المحتوى بتغييرات طفيفة في الشخصية مقابل التحكم الدقيق، فقد يظل سير عمل Gemini Omni الحالي قابلاً للتطبيق.
ما يجب مراقبته مستقبلاً
- تحسينات النماذج التي تعمل على تثبيت الكود الكامن (latent code) للشخصية عبر الأوامر النصية المختلفة.
- حلقات ملاحظات المستخدمين التي تسمح لصناع المحتوى بالإبلاغ عن "الانحراف" وطلب "إعادة تثبيت" (re-anchor) للشخصية.
الخلاصة
يمكن لـ Gemini Omni إنتاج فيديو مصقول متعدد العناصر عند تزويده بمجموعة كاملة من التعليمات دفعة واحدة، ولكن دقة الشخصية تتدهور عند تكديس التعديلات.
