Token Templat Membolehkan Pemangkasan Head

Token templat membolehkan penyelidik mengurangkan kira-kira satu perlima daripada beban kerja transformer difusi tanpa latihan semula; kesan terhadap kualiti hampir tidak kelihatan.

Satu kajian baharu mendapati bahawa token tertentu bertindak sebagai daftar semantik (semantic registers)—"sink" kecil yang mengumpul maklumat daripada prom. Dengan menjejaki head perhatian (attention heads) yang paling fokus pada daftar ini, penulis membuang head tersebut, sekali gus mengurangkan kira-kira 20% FLOPs perhatian model sementara penanda aras GenEval hanya merosot sebanyak 1.4 mata.

Mengapa pemangkasan penting untuk model difusi

Transformer difusi memacu banyak penjana teks-ke-imej. Lapisan perhatiannya mendominasi bajet pengiraan semasa inferens, jadi pengurangan yang kecil sekalipun dapat mempercepatkan penjanaan imej dan mengurangkan penggunaan tenaga. Teknik pemangkasan sedia ada biasanya memeriksa magnitud pemberat atau isyarat kecerunan, dengan andaian bahawa setiap head menyumbang secara sama rata. Pendekatan menyeluruh tersebut sama ada membiarkan terlalu banyak kerja tidak disentuh atau menjejaskan kualiti output apabila terlalu banyak head dibuang.

Trik token templat

Penyelidik memerhatikan bahawa segelintir token secara konsisten mengumpul petunjuk tahap objek daripada prom teks. "Token templat" ini bertindak seperti daftar khusus: ia menyerap semantik prom dan menyalurkannya ke peringkat seterusnya sementara bahagian model yang lain terus memproses butiran visual.

Saluran pemangkasan adalah mudah:

  1. Jalankan 'forward pass' pada beberapa prom dan rekodkan skor perhatian.
  2. Kenal pasti head yang mempunyai sambungan terkuat ke arah token templat.
  3. Buang head tersebut daripada model; tiada data tambahan, penalaan halus (fine-tuning), atau perubahan seni bina yang diperlukan.

Oleh kerana head yang dibuang itu sebahagian besarnya menyampaikan maklumat prom yang sama yang sudah dipegang oleh token templat, aliran isyarat keseluruhan kekal utuh.

Angka yang membuktikan keberkesanannya

Mengaplikasikan kaedah ini kepada transformer difusi teks-ke-imej standard menghasilkan:

  • ≈ 20% pengurangan dalam FLOPs perhatian, yang mempercepatkan inferens secara langsung.
  • Penurunan skor GenEval sebanyak hanya 1.4 mata, satu penurunan kecil memandangkan peningkatan pengiraan yang diperoleh.
  • Keupayaan untuk memangkas 20%–30% head sambil mengekalkan kesetiaan visual (visual fidelity) yang hampir tidak berubah.

Sebaliknya, pemotongan peratusan head secara naif sering menyebabkan penurunan kualiti yang lebih besar, kerana ia membuang laluan campuran konteks yang berguna tanpa pilih kasih.

Had dan persoalan terbuka

Kerja ini tertumpu secara eksklusif kepada transformer difusi yang menterjemah prom teks kepada imej. Masih belum jelas sama ada fenomena token templat yang sama muncul dalam model bahasa yang lebih besar atau seni bina multimodal yang lain. Jika daftar tersebut tiada atau berkelakuan berbeza, kaedah pemangkasan ini mungkin kehilangan kelebihannya.

Satu lagi perkara yang perlu diperhatikan ialah penurunan kualiti yang kecil.

Apa yang perlu diperhatikan seterusnya

Penyelidikan masa hadapan berkemungkinan akan menyiasat:

  • Sama ada token templat muncul secara semula jadi dalam keluarga transformer yang lain.
  • Bagaimana pendekatan ini berskala dengan saiz model dan volum data latihan.

Rumusan: Dengan mengeksploitasi peranan tersembunyi token templat sebagai daftar semantik, penyelidik telah menemui cara yang jitu untuk memangkas transformer difusi—mengurangkan kira-kira satu perlima daripada beban kerja sambil mengekalkan kualiti output yang hampir utuh. Ini boleh menjadikan imej janaan AI lebih pantas dan murah tanpa memerlukan latihan semula yang mahal.