טוקנים של תבנית מאפשרים גיזום ראשים (Head Pruning)

טוקנים של תבנית (Template tokens) מאפשרים לחוקרים לקצץ כחמישית מעבודתו של טרנספורמר דיפוזיה (diffusion transformer) ללא צורך באימון מחדש; הפגיעה באיכות כמעט ואינה מורגשת.

מחקר חדש מצא כי טוקנים מסוימים פועלים כרגיסטרים סמנטיים (semantic registers) — "בורות" (sinks) זעירים האוגרים מידע מהפרומפט. על ידי מעקב אחר אילו ראשי תשומת לב (attention heads) מתמקדים ביותר ברגיסטרים אלו, המחברים מסירים את הראשי הללו, ובכך מקצצים כ-20% מ-FLOPs של תשומת הלב של המודל, בעוד שמדד ה-GenEval יורד ב-1.4 נקודות בלבד.

מדוע גיזום (pruning) חשוב למודלי דיפוזיה

טרנספורמרים של דיפוזיה מניעים מנועי יצירת טקסט-לתמונה רבים. שכבות תשומת הלב שלהם שולטות בתקציב החישוב במהלך ההסקה (inference), כך שגם הפחתות צנועות מאיצות את יצירת התמונה ומפחיתות את צריכת האנרגיה. טכניקות גיזום קיימות בוחנות בדרך כלל את גודל המשקולות או אותות גרדיאנט, מתוך הנחה שכל ראש תורם באופן שווה. גישה גורפת זו משאירה או יותר מדי עבודה ללא טיפול, או פוגעת באיכות הפלט כאשר מסירים יותר מדי ראשים.

טריק טוקן-התבנית

החוקרים הבחינו שקבוצה קטנה של טוקנים אוספת באופן עקבי רמזים ברמת האובייקט מהפרומפט הטקסטואלי. "טוקני תבנית" אלו מתנהגים כרגיסטרים ייעודיים: הם סופגים את הסמנטיקה של הפרומפט ומעבירים אותה הלאה, בעוד שאר המודל ממשיך בעיבוד הפרטים הוויזואליים.

תהליך הגיזום הוא פשוט:

  1. הרצת מעבר קדימה (forward pass) על מספר פרומפטים ותיעוד ציוני תשומת הלב.
  2. זיהוי ראשים שהקשרים החזקים ביותר שלהם מצביעים על טוקני התבנית.
  3. הסרת הראשי הללו מהמודל; אין צורך בנתונים נוספים, כוונון עדין (fine-tuning) או שינויים ארכיטקטוניים.

מכיוון שהראשים שהוסרו העבירו בעיקר את אותו מידע מהפרומפט שכבר נמצא אצל טוקני התבנית, זרימת האות הכללית נשארת ללא שינוי.

מספרים שמדברים בעד עצמם

יישום השיטה על טרנספורמרים סטנדרטיים של דיפוזיה טקסט-לתמונה מניב:

  • הפחתה של כ-20% ב-FLOPs של תשומת הלב, מה שמאיץ ישירות את ההסקה.
  • ירידה בציון GenEval של 1.4 נקודות בלבד, ירידה שולית בהתחשב ברווח החישובי.
  • יכולת לגזום 20%–30% מהראשים תוך שמירה על נאמנות ויזואלית (visual fidelity) ללא שינוי משמעותי.

לעומת זאת, חיתוכים נאיביים המבוססים על אחוז הראשיים גורמים לעיתים קרובות לירידות איכות גדולות יותר, שכן הם משמידים ללא הבחנה נתיבי ערבוב הקשר (context-mixing) מועילים.

מגבלות ושאלות פתוחות

העבודה מתמקדת אך ורק בטרנספורמרים של דיפוזיה המתרגמים פרומפטים טקסטואליים לתמונות. לא ברור אם תופעת טוקן-התבנית מופיעה במודלי שפה גדולים יותר או בארכיטקטורות מולטי-מודאליות אחרות. אם הרגיסטרים אינם קיימים או מתנהגים אחרת, מתכון הגיזום עלול לאבד את יתרונו.

נקודת זהירות נוספת היא הירידה המתונה באיכות.

מה לעקוב אחריו בהמשך

מחקר עתידי יבחן ככל הנראה:

  • האם טוקני תבנית מופיעים באופן טבעי במשפחות טרנספורמרים אחרות.
  • כיצד הגישה מתרחבת (scales) עם גודל המודל ונפח נתוני האימון.

שורה תחתונה: על ידי ניצול התפקיד הנסתר של טוקני תבנית כרגיסטרים סמנטיים, חוקרים מצאו דרך "כירורגית" לקצץ בטרנספורמרים של דיפוזיה — קיצוץ של כחמישית מהעבודה תוך שמירה על איכות הפלט כמעט ללא שינוי. זה עשוי להפוך תמונות שנוצרו על ידי בינה מלאכותית למהירות וזולות יותר ללא צורך באימון מחדש יקר.