כותרת: Latent Identity Tuning מאפשר עריכות פנים מדויקות
חוקרים הציגו את Latent-Identity Tuning, טכניקה המאפשרת למפתחים לערוך תווי פנים במחוללי טקסט-לתמונה תוך שמירה על זהות הנושא ללא שינוי, והיא פועלת ללא צורך באימון נוסף.
רוב מודלי הטקסט-לתמונה מבוססי הדיפוזיה (diffusion) מטשטשים או משנים את דמיונו של האדם כאשר מתבקשים לשנות פרטים קטנים — להחליף צורה של גבה, להזיז אף או לשנות צבע עיניים. הבעיה נובעת מהאופן שבו מודלים אלו מקודדים פנים כמערך צפוף של משתנים לטנטיים; שינוי קל של אחד מהם נוטה להשפיע על התמונה כולה, ובכך לפגוע בזהות.
LIT עוקפת זאת על ידי שימוש ב-encoder קפוא ממודל קיים ובדיקת המרחב הלטנטי שלו כדי למצוא כיוונים המתאימים למאפייני פנים נפרדים. במקום לאמן מחדש את הרשת כולה או להזין נתונים חדשים, השיטה מבודדת טוקנים (tokens) לטנטיים בודדים, שכל אחד מהם שולט בחלק ספציפי בפנים. טוקן אחד עשוי לשלוט בצורת הגבה. אחר עשוי לשלוט במבנה האף. על ידי התאמת הערך של טוקן בודד, מפתחים יכולים לשנות את המאפיין הזה בזמן שהטוקנים הסובבים שומרים על שאר הפורטרט ללא שינוי.
הגישה מציעה ארבע יתרונות מעשיים:
- דיוק – השינויים נשארים מוגבלים למאפיין המיועד, תוך שמירה על המראה הכללי.
- עומס חישוב נמוך – ה-encoder הקפוא אומר שאין צורך בלולאות אימון חדשות, כך שהעומס החישובי נשאר מינימלי.
- עקביות הזהות – הדמיון לאדם נשמר גם לאחר עריכות במספר תמונות או הנחיות (prompts) שונות.
- מהירות יציאה לשוק – דילוג על שלב האימון מקצר את מחזור הפיתוח עבור אפליקציות הזקוקות למניפולציה של פנים בזמן אמת.
מקרי בוחן שיפיקו תועלת מיידית כוללים מדידות וירטואליות (virtual try-ons), שבהן קונה יכול לראות משקפיים או איפור על פניו שלו מבלי שהמודל ימציא זהות חדשה, וכלי ליצירת אווטארים המאפשרים למשתמשים לדייק הבעות פנים, גיל או צבע עיניים בזמן אמת.
