Google Vids از آواتارهای هوش مصنوعی سفارشی و ادغام با Gemini Omni رونمایی کرد

گوگل در حال تبدیل ابزار محیط کار مبتنی بر هوش مصنوعی خود به قدرتی بی‌بدیل برای تولید ویدیوهای شخصی‌سازی‌شده است. با آخرین به‌روزرسانی‌های Google Vids، کاربران اکنون می‌توانند آواتارهای دیجیتال سفارشی بسازند که ظاهر و صدای آن‌ها را تقلید می‌کند؛ امری که نشان‌دهنده تغییری بزرگ در نحوه رویکرد کسب‌وکارها به ارتباطات ویدئویی است.

ورود آواتارهای دیجیتال شخصی‌سازی‌شده به محیط کار

در اقدامی که مستقیماً بازار حرفه‌ای تولید ویدیو را هدف قرار می‌دهد، Google Vids اکنون به کاربران اجازه می‌دهد تا در محتوای خود «نقش اصلی» را ایفا کنند. کاربران می‌توانند تنها با آپلود یک سلفی و یک فایل ضبط‌شده از صدای خود، یک آواتار دیجیتال سفارشی ایجاد کنند که ظاهر و صدای آن به‌طور قابل‌توجهی شبیه به آن‌هاست. این ویژگی برای تسهیل تولید به‌روزرسانی‌های شرکتی، ویدیوهای آموزشی و ارتباطات داخلی، بدون نیاز به فیلم‌برداری مداوم، طراحی شده است.

برای رسیدگی به نگرانی‌های اخلاقی پیرامون دیپ‌فیک‌ها (deepfakes)، گوگل در حال اجرای تدابیر حفاظتی سخت‌گیرانه‌ای است. این آواتارهای شخصی‌سازی‌شده به‌طور خاص به حساب Google کاربر متصل هستند و با استفاده از فناوری SynthID به‌صورت نامرئی واترمارک‌گذاری می‌شوند. دسترسی به این ویژگی‌های آواتار در حال حاضر به کاربران ۱۸ سال به بالا در مناطق جغرافیایی خاص محدود شده است تا از عرضه کنترل‌شده این رسانه‌های مصنوعی با کیفیت بالا اطمینان حاصل شود.

تقویت خلاقیت با Gemini Omni

تکامل Google Vids با ادغام Gemini Omni، مدل هوش مصنوعی چندوجهی (multi-modal) پیشرفته گوگل، شتاب گرفته است. این ادغام، یک جریان کاری پیچیده «متن به ویدیو» (prompt-to-video) را ممکن می‌سازد که در آن کاربران می‌توانند دستورات متنی نوشته‌شده را با تصاویر مرجع آپلودشده ترکیب کنند. Gemini Omni این ورودی‌های متفاوت را برای تولید سکانس‌های ویدیویی منسجم ترکیب می‌کند.

Gemini Omni فراتر از تولید صرف، به‌عنوان یک مجموعه هوشمند پس‌تولید (post-production) عمل می‌کند. این مدل می‌تواند وظایف بصری پیچیده‌ای مانند تعویض پس‌زمینه، اصلاح مشکلات نورپردازی در ویدیوهای ضبط‌شده با تلفن همراه و افزودن جلوه‌های سینمایی را انجام دهد. نکته حیاتی این است که این به‌روزرسانی، پشتیبانی از ویرایش‌های مرحله‌به‌مرحله را معرفی می‌کند. این قابلیت به سازندگان اجازه می‌دهد تا تغییرات دقیق و تکرارشونده را در حین کار روی پروژه‌های خود اعمال کنند و از کلافگیِ نیاز به شروع مجدد رندر از ابتدا برای اصلاح یک جزئیات کوچک، جلوگیری شود.

تغییر چشم‌انداز رقابتی

این به‌روزرسانی‌ها نشان‌دهنده یک چرخش استراتژیک برای گوگل است. در حالی که Vids در ابتدا به‌عنوان یک ابزار ارائه با کمک هوش مصنوعی برای Google Workspace معرفی شده بود، اکنون به‌سرعت در حال تبدیل شدن به یک پلتفرم همه‌کاره برای تولید ویدیو است. گوگل با گنجاندن مستقیم این قابلیت‌ها در اکوسیستم Workspace، از اسلایدهای ساده فراتر رفته و به قلمرو تولید ویدیوهای سطح بالا وارد شده است.

این تکامل، گوگل را در رقابت مستقیم با استارتاپ‌های تخصصی ویدیو مبتنی بر هوش مصنوعی مانند HeyGen، Synthesia، Captions و D-ID قرار می‌دهد. در حالی که تمرکز اصلی آن پلتفرم‌ها بر ارائه‌دهندگان مصنوعی (synthetic presenters) است، مزیت گوگل در ادغام بی‌نقص آن با جریان‌های کاری موجود در سازمان‌ها نهفته است. برای بنیان‌گذاران و توسعه‌دهندگان، این نشان‌دهنده روندی است که در آن مدل‌های چندوجهی مانند Gemini Omni از آزمایش‌های تحقیقاتی به اجزای ضروری و تعاملی در پشته‌های بهره‌وری حرفه‌ای تبدیل می‌شوند.

نکات کلیدی

  • دوقلوهای دیجیتال سفارشی: کاربران می‌توانند تنها با استفاده از یک سلفی و یک فایل ضبط‌شده از صدا، آواتارهای هوش مصنوعی بسازند و پیام‌رسانی ویدئویی حرفه‌ای را تسهیل کنند.
  • ویرایش چندوجهی: ادغام Gemini Omni امکان تولید ویدیوی پیچیده مبتنی بر دستور (prompt) و ویرایش‌های بصری مرحله‌به‌مرحله و تکرارشونده را فراهم می‌کند.
  • امنیت در سطح سازمانی: تمام آواتارهای شخصی‌سازی‌شده توسط واترمارک نامرئی SynthID محافظت می‌شوند و برای جلوگیری از سوءاستفاده، به حساب‌های تأییدشده Google متصل هستند.