Template Tokens cho phép cắt tỉa head

Template tokens cho phép các nhà nghiên cứu cắt giảm khoảng 1/5 khối lượng công việc của một diffusion transformer mà không cần huấn luyện lại; sự sụt giảm về chất lượng là không đáng kể.

Một nghiên cứu mới phát hiện ra rằng một số token nhất định đóng vai trò như các thanh ghi ngữ nghĩa (semantic registers)—những "điểm thu nhận" (sinks) nhỏ bé chuyên tích trữ thông tin từ prompt. Bằng cách theo dõi các attention head tập trung nhiều nhất vào các thanh ghi này, các tác giả đã loại bỏ các head đó, giúp giảm khoảng 20% lượng FLOPs attention của mô hình trong khi điểm GenEval benchmark chỉ giảm 1,4 điểm.

Tại sao việc cắt tỉa lại quan trọng đối với các mô hình diffusion

Diffusion transformer là nền tảng của nhiều trình tạo văn bản thành hình ảnh (text-to-image). Các lớp attention của chúng chiếm phần lớn ngân sách tính toán trong quá trình suy luận (inference), vì vậy ngay cả những sự cắt giảm khiêm tốn cũng có thể tăng tốc độ tạo ảnh và giảm mức tiêu thụ năng lượng. Các kỹ thuật cắt tỉa hiện nay thường kiểm tra độ lớn của trọng số (weight magnitude) hoặc tín hiệu gradient, với giả định rằng mọi head đều đóng góp như nhau. Cách tiếp cận đại trà đó hoặc là để lại quá nhiều công việc không được xử lý, hoặc là làm tổn hại chất lượng đầu ra khi loại bỏ quá nhiều head.

Thủ thuật template-token

Các nhà nghiên cứu quan sát thấy rằng một nhóm nhỏ các token liên tục thu thập các manh mối ở cấp độ đối tượng từ prompt văn bản. Những "template token" này hoạt động giống như các thanh ghi chuyên dụng: chúng hấp thụ ngữ nghĩa của prompt và truyền chúng xuống các lớp sau (downstream), trong khi phần còn lại của mô hình tiếp tục xử lý các chi tiết hình ảnh.

Quy trình cắt tỉa rất đơn giản:

  1. Chạy một lượt truyền xuôi (forward pass) trên một vài prompt và ghi lại điểm attention.
  2. Xác định các head có kết nối mạnh nhất hướng tới các template token.
  3. Loại bỏ các head đó khỏi mô hình; không cần thêm dữ liệu, tinh chỉnh (fine-tuning) hay thay đổi kiến trúc.

Vì các head bị loại bỏ chủ yếu truyền tải cùng một thông tin prompt mà các template token đã nắm giữ, luồng tín hiệu tổng thể vẫn được giữ nguyên vẹn.

Những con số biết nói

Áp dụng phương pháp này vào các diffusion transformer text-to-image tiêu chuẩn mang lại:

  • Giảm ≈ 20% lượng FLOPs attention, trực tiếp tăng tốc độ suy luận.
  • Điểm GenEval chỉ giảm 1,4 điểm, một mức giảm không đáng kể so với hiệu quả tính toán đạt được.
  • Khả năng cắt tỉa 20%–30% số lượng head trong khi vẫn giữ độ trung thực về hình ảnh (visual fidelity) gần như không đổi.

Ngược lại, việc cắt tỉa theo tỷ lệ phần trăm head một cách ngây thơ thường gây ra sự sụt giảm chất lượng lớn hơn, vì chúng loại bỏ một cách bừa bãi các đường dẫn trộn ngữ cảnh (context-mixing pathways) hữu ích.

Hạn chế và các câu hỏi mở

Nghiên cứu này chỉ tập trung duy nhất vào các diffusion transformer chuyển đổi prompt văn bản thành hình ảnh. Vẫn chưa rõ liệu hiện tượng template-token tương tự có xuất hiện trong các mô hình ngôn ngữ lớn hơn hoặc các kiến trúc đa phương thức (multimodal) khác hay không. Nếu các thanh ghi này không tồn tại hoặc hoạt động khác đi, công thức cắt tỉa có thể sẽ mất đi ưu thế.

Một điểm cần lưu ý khác là sự sụt giảm chất lượng dù nhỏ.

Những điều cần theo dõi tiếp theo

Các nghiên cứu trong tương lai có thể sẽ tìm hiểu:

  • Liệu các template token có xuất hiện tự nhiên trong các họ transformer khác hay không.
  • Cách tiếp cận này mở rộng (scale) như thế nào với kích thước mô hình và khối lượng dữ liệu huấn luyện.

Bài học rút ra: Bằng cách khai thác vai trò ẩn của các template token như những thanh ghi ngữ nghĩa, các nhà nghiên cứu đã tìm ra một cách cắt tỉa chính xác cho các diffusion transformer—giảm khoảng 1/5 khối lượng công việc trong khi vẫn giữ chất lượng đầu ra gần như nguyên vẹn. Điều này có thể giúp việc tạo ảnh bằng AI nhanh hơn và rẻ hơn mà không cần quá trình huấn luyện lại tốn kém.