Template Tokens ช่วยให้สามารถทำ Head Pruning ได้
Template tokens ช่วยให้นักวิจัยสามารถลดภาระงานของ diffusion transformer ลงได้ประมาณหนึ่งในห้าโดยไม่ต้องเทรนใหม่ และผลกระทบต่อคุณภาพนั้นแทบจะไม่สังเกตเห็นได้เลย
การศึกษาใหม่พบว่าโทเคนบางตัวทำหน้าที่เป็น semantic registers หรือ "แหล่งกักเก็บ" ขนาดเล็กที่รวบรวมข้อมูลจาก prompt ไว้ ด้วยการติดตามว่า attention heads ใดที่มุ่งเน้นไปยัง registers เหล่านี้มากที่สุด ผู้เขียนจึงทำการตัด heads เหล่านั้นออก ซึ่งช่วยลด attention FLOPs ของโมเดลลงได้ประมาณ 20% ในขณะที่คะแนน GenEval benchmark ลดลงเพียง 1.4 คะแนนเท่านั้น
ทำไมการทำ pruning ถึงสำคัญสำหรับ diffusion models
Diffusion transformers เป็นขุมพลังให้กับเครื่องมือสร้างภาพจากข้อความ (text-to-image generators) จำนวนมาก เลเยอร์ attention ของโมเดลเหล่านี้ใช้ทรัพยากรในการคำนวณส่วนใหญ่ระหว่างการทำ inference ดังนั้นแม้แต่การลดภาระงานเพียงเล็กน้อยก็สามารถช่วยให้การสร้างภาพเร็วขึ้นและลดการใช้พลังงานได้ เทคนิคการทำ pruning ที่มีอยู่ในปัจจุบันมักจะตรวจสอบขนาดของน้ำหนัก (weight magnitude) หรือสัญญาณเกรเดียนต์ (gradient signals) โดยสมมติว่าทุก head มีส่วนช่วยเท่าๆ กัน ซึ่งแนวทางแบบเหมาเข่งนี้อาจทำให้เหลือภาระงานที่ไม่ได้ถูกจัดการมากเกินไป หรืออาจส่งผลเสียต่อคุณภาพของผลลัพธ์หากมีการตัด heads ออกมากเกินไป
เทคนิค template-token
นักวิจัยสังเกตพบว่ามีโทเคนเพียงไม่กี่ตัวที่รวบรวมข้อมูลระดับวัตถุ (object-level cues) จาก text prompt อย่างสม่ำเสมอ "template tokens" เหล่านี้ทำหน้าที่เหมือน registers เฉพาะทาง โดยจะดูดซับความหมาย (semantics) ของ prompt และส่งต่อไปยังส่วนอื่นๆ ในขณะที่ส่วนที่เหลือของโมเดลยังคงประมวลผลรายละเอียดทางภาพต่อไป
ขั้นตอนการทำ pruning นั้นตรงไปตรงมา:
- รัน forward pass กับ prompt จำนวนหนึ่งและบันทึกค่า attention scores
- ระบุ heads ที่มีการเชื่อมต่อที่แข็งแกร่งที่สุดไปยัง template tokens
- ตัด heads เหล่านั้นออกจากโมเดล โดยไม่จำเป็นต้องใช้ข้อมูลเพิ่มเติม การทำ fine-tuning หรือการเปลี่ยนแปลงโครงสร้างสถาปัตยกรรม
เนื่องจาก heads ที่ถูกตัดออกนั้นทำหน้าที่เพียงส่งต่อข้อมูล prompt ชุดเดียวกับที่ template tokens ถือไว้อยู่แล้ว การไหลของสัญญาณโดยรวมจึงยังคงสมบูรณ์
ตัวเลขที่พิสูจน์ผลลัพธ์ได้ด้วยตัวเอง
เมื่อนำวิธีนี้ไปใช้กับ diffusion transformers สำหรับ text-to-image มาตรฐาน จะได้ผลลัพธ์ดังนี้:
- ลด attention FLOPs ลงประมาณ 20% ซึ่งช่วยเพิ่มความเร็วในการทำ inference โดยตรง
- คะแนน GenEval ลดลงเพียง 1.4 คะแนน ซึ่งถือเป็นการลดลงเพียงเล็กน้อยเมื่อเทียบกับประสิทธิภาพการคำนวณที่ได้รับ
- สามารถทำ pruning heads ได้ถึง 20%–30% โดยที่ความสมจริงของภาพ (visual fidelity) ยังคงแทบไม่เปลี่ยนแปลง
ในทางตรงกันข้าม การตัด heads ตามสัดส่วนเปอร์เซ็นต์แบบพื้นฐานที่ขาดความละเอียด (naïve head-percentage cuts) มักจะทำให้คุณภาพลดลงมากกว่า เนื่องจากเป็นการตัดเส้นทางการผสมผสานบริบท (context-mixing pathways) ที่มีประโยชน์ออกไปอย่างไม่เลือกหน้า
ข้อจำกัดและคำถามที่ยังไม่มีคำตอบ
งานวิจัยนี้มุ่งเน้นไปที่ diffusion transformers ที่แปลง text prompt เป็นรูปภาพเท่านั้น ยังไม่เป็นที่แน่ชัดว่าปรากฏการณ์ template-token แบบเดียวกันนี้จะเกิดขึ้นในโมเดลภาษาขนาดใหญ่ (LLMs) หรือสถาปัตยกรรมแบบ multimodal อื่นๆ หรือไม่ หากไม่มี registers เหล่านี้หรือหากพวกมันทำงานต่างออกไป สูตรการทำ pruning นี้ก็อาจจะไม่ได้ผลดีเท่าเดิม
อีกจุดหนึ่งที่ควรระวังคือการลดลงของคุณภาพที่เกิดขึ้นเล็กน้อย
สิ่งที่ควรจับตามองต่อไป
การวิจัยในอนาคตมีแนวโน้มที่จะสำรวจในเรื่อง:
- ว่า template tokens จะเกิดขึ้นเองตามธรรมชาติในตระกูล transformer อื่นๆ หรือไม่
- วิธีการนี้จะขยายผล (scale) ตามขนาดของโมเดลและปริมาณข้อมูลที่ใช้เทรนได้อย่างไร
สรุปสาระสำคัญ: ด้วยการใช้ประโยชน์จากบทบาทที่ซ่อนอยู่ของ template tokens ในฐานะ semantic registers นักวิจัยได้ค้นพบวิธีที่แม่นยำในการตัดทอน diffusion transformers โดยลดภาระงานลงประมาณหนึ่งในห้าในขณะที่ยังคงรักษาคุณภาพของผลลัพธ์ไว้ได้เกือบทั้งหมด สิ่งนี้อาจทำให้การสร้างภาพด้วย AI เร็วขึ้นและราคาถูกลงโดยไม่ต้องเสียค่าใช้จ่ายสูงในการเทรนใหม่
