عنوان: تنظیم هویت نهفته (Latent Identity Tuning) ویرایشهای دقیق چهره را امکانپذیر میکند
محققان تکنیک Latent-Identity Tuning را معرفی کردهاند؛ روشی که به توسعهدهندگان اجازه میدهد ویژگیهای چهره را در مولدهای متن به تصویر ویرایش کنند، در حالی که هویت سوژه دستنخورده باقی میماند و این کار بدون نیاز به هیچگونه آموزش اضافی انجام میشود.
اکثر مدلهای متن به تصویر مبتنی بر انتشار (diffusion-based)، هنگام درخواست برای تغییر جزئیات کوچک — مانند تغییر شکل ابرو، جابهجایی بینی یا تغییر رنگ چشم — شباهت چهره فرد را تار یا تغییر میدهند. این مشکل از نحوه کدگذاری چهره توسط این مدلها به عنوان مجموعهای متراکم از متغیرهای نهفته (latent variables) ناشی میشود؛ دستکاری هر یک از آنها تمایل دارد در کل تصویر اثر بگذارد و باعث از بین رفتن هویت شود.
روش LIT با استفاده از رمزگذار (encoder) منجمد از یک مدل موجود و کاوش در فضای نهفته آن برای یافتن جهتهایی که با ویژگیهای مجزای چهره مطابقت دارند، این مشکل را دور میزند. این روش به جای بازآموزی کل شبکه یا تغذیه دادههای جدید، توکنهای نهفته مجزایی را جدا میکند که هر کدام بخش خاصی از چهره را کنترل میکنند. یک توکن ممکن است شکل ابرو را کنترل کند و توکن دیگر ساختار بینی را. با تنظیم مقدار یک توکن واحد، توسعهدهندگان میتوانند آن ویژگی را تغییر دهند، در حالی که توکنهای اطراف، بقیه پرتره را بدون تغییر نگه میدارند.
این رویکرد چهار مزیت کاربردی را ارائه میدهد:
- دقت – تغییرات محدود به ویژگی هدف باقی میمانند و ظاهر کلی حفظ میشود.
- محاسبات کم – استفاده از رمزگذار منجمد به معنای عدم نیاز به حلقههای آموزشی جدید است، بنابراین بار محاسباتی در حداقل سطح باقی میماند.
- ثبات هویت – شباهت چهره همان فرد در ویرایشهای مختلف در چندین تصویر یا دستور (prompt) حفظ میشود.
- سرعت ورود به بازار – حذف مرحله آموزش، چرخه توسعه را برای برنامههایی که نیاز به دستکاری آنی چهره دارند، کوتاهتر میکند.
موارد استفادهای که بلافاصله از این فناوری بهره میبرند شامل «پرو مجازی» (virtual try-ons) است، جایی که خریدار میتواند عینک یا آرایش را روی چهره خود ببیند بدون اینکه مدل هویت جدیدی ابداع کند، و همچنین ابزارهای ساخت آواتار که به کاربران اجازه میدهند حالات چهره، سن یا رنگ چشم را در لحظه تنظیم کنند.
