PIVOT, một thủ thuật mới trong thời gian suy luận dành cho các mô hình chú ý thưa (sparse-attention), giúp giảm chi phí bộ lập chỉ mục (indexer) lên đến bốn lần và cắt giảm độ trễ tổng thể khoảng 1,6×, tất cả mà không cần thay đổi trọng số của mô hình. Nó hoạt động bằng cách nhóm các truy vấn (queries) và để một truy vấn "đại diện" (proxy query) duy nhất thực hiện các công việc nặng nhọc.
Tại sao chú ý thưa bị đình trệ ở mức 100 K tokens
Chú ý thưa (sparse attention) được thiết kế để cho phép các mô hình transformer xử lý các chuỗi rất dài—như 100 K tokens hoặc hơn—trong khi vẫn giữ cho chi phí tính toán ở mức hợp lý. Trên thực tế, tốc độ tăng trưởng hứa hẹn sẽ tan biến ngay khi chuỗi vượt quá vài chục nghìn tokens. Thủ phạm chính là bộ lập chỉ mục (indexer), thứ thực hiện chấm điểm mọi token so với mọi truy vấn để quyết định những token nào thuộc về mẫu thưa. Công việc của nó tỷ lệ thuận với O(L²) (L = độ dài chuỗi), vì vậy ở mức 100 K tokens, chỉ riêng bộ lập chỉ mục đã chiếm phần lớn thời gian chạy và làm mất đi bất kỳ lợi ích nào từ tính thưa.
Hai quan sát đằng sau PIVOT
Các nhà nghiên cứu phát hiện ra rằng các truy vấn liền kề hầu như luôn chọn cùng một nhóm các token top-k—độ trùng lặp khoảng 90 %. Điều đó có nghĩa là một truy vấn đại diện duy nhất có thể thay thế cho cả một nhóm các truy vấn lân cận mà vẫn tìm ra được một tập hợp ứng viên hữu ích. PIVOT tận dụng điều này bằng cách:
- Nhóm một số lượng cố định các truy vấn liên tiếp (kích thước g).
- Tính trung bình nhóm đó để tạo ra một truy vấn đại diện (proxy query).
- Chạy bộ lập chỉ mục một lần trên truy vấn đại diện thay vì chạy cho từng truy vấn gốc.
- Tinh chỉnh danh sách ứng viên của truy vấn đại diện cho từng thành viên trong nhóm.
Phép toán giảm từ O(L²) xuống O(L² / g). Với kích thước nhóm là tám, bộ lập chỉ mục sẽ thực hiện ít hơn tám lần quét toàn bộ.
Hai chế độ vận hành
- PIVOT-Refine giữ nguyên độ chính xác của bộ lập chỉ mục dày đặc (dense indexer) trong khi mang lại tốc độ tăng trưởng khoảng ba lần ở giai đoạn lập chỉ mục.
- PIVOT-Reuse đẩy tốc độ lên cao hơn nữa, chấp nhận hy sinh một lượng nhỏ độ chính xác để đạt được mức tăng thông lượng tối đa.
Các bài kiểm tra hiệu năng (benchmarks) trên các mô hình DeepSeek-V3.2 và GLM-5.1 cho thấy tốc độ bộ lập chỉ mục tăng gấp bốn lần nhất quán và độ trễ đầu-cuối giảm 1,6× khi áp dụng PIVOT trong quá trình suy luận.
Triển khai dạng "cắm là chạy" (plug-and-play)
Kỹ thuật này được cung cấp dưới dạng một bản triển khai tham chiếu có thể được đưa vào bất kỳ quy trình Dynamic Sparse Attention (DSA) hiện có nào. Nó không yêu cầu thay đổi trọng số, vì vậy các mô hình được huấn luyện với các phương pháp sparse-attention tiêu chuẩn vẫn hoạt động bình thường. Lưu ý duy nhất là mã tham chiếu chạy trên các nhân (kernel) GPU thông thường; việc triển khai thực tế sẽ cần các nhân Triton hoặc CUDA được tinh chỉnh thủ công để đạt được tiềm năng tốc độ tối đa.
Những sự đánh đổi là gì
Lợi thế về tốc độ của PIVOT-Reuse đi kèm với sự sụt giảm nhẹ về chất lượng chú ý, điều này có thể quan trọng đối với các tác vụ cực kỳ nhạy cảm với việc lựa chọn token chính xác. Các đội ngũ phải cân nhắc sự mất mát đó với ngân sách độ trễ của họ. Ngoài ra, nhu cầu về các nhân (kernel) tùy chỉnh sẽ làm tăng gánh nặng kỹ thuật cho các tổ chức không có chuyên môn về GPU-kernel.
Điều cần theo dõi tiếp theo
PIVOT cho thấy rằng việc sắp xếp lại công việc một cách thông minh—nhóm các truy vấn và chia sẻ một lần quét đại diện—có thể khôi phục lại tiềm năng của chú ý thưa cho các ngữ cảnh thực sự dài, mang lại những mức tăng tốc đáng kể mà không tốn chi phí huấn luyện lại.
