AWS đã thêm tùy chọn “định tuyến nhận biết tiền tố” (prefix-aware routing) vào Amazon SageMaker Inference, hứa hẹn tỷ lệ trúng cache (cache-hit rates) cao hơn và độ trễ thấp hơn đáng kể cho những khách hàng chạy các mô hình ngôn ngữ lớn (LLM) trên hạ tầng riêng của họ. Thay đổi này quan trọng vì nó mang lại độ trễ thấp hơn rõ rệt và giảm chi phí tính toán GPU.

Tại sao độ trễ LLM lại quan trọng

Khi một LLM nhận được một yêu cầu, thông thường nó sẽ tính toán lại cơ chế chú ý (attention) trên toàn bộ prompt—một bước tốn kém và sẽ tăng dần theo mỗi token được thêm vào. Nếu mô hình có thể tái sử dụng bộ nhớ đệm attention (attention cache) từ một yêu cầu trước đó, nó chỉ cần xử lý phần văn bản mới. Các khối lượng công việc gửi lặp đi lặp lại cùng một prompt hệ thống hoặc duy trì lịch sử hội thoại là những ứng cử viên hàng đầu cho việc tái sử dụng cache.

Trong thiết lập SageMaker mặc định, các yêu cầu đến được phân phối ngẫu nhiên qua nhóm các instance suy luận. Phân phối ngẫu nhiên có nghĩa là một yêu cầu lẽ ra có thể trúng vào một cache nóng (warm cache) thường lại rơi vào một instance lạnh (cold instance), buộc phải tính toán lại toàn bộ. Kết quả là độ trễ cao hơn và tiêu tốn thêm các chu kỳ GPU, dẫn trực tiếp đến chi phí cao hơn.

Cách thức hoạt động của định tuyến nhận biết tiền tố

Chế độ định tuyến mới duy trì một bản đồ nhẹ (lightweight map) về các tiền tố yêu cầu gần đây—về cơ bản là phần đầu của một prompt thường giữ nguyên qua các lần gọi. Khi một yêu cầu mới đến, SageMaker sẽ kiểm tra bản đồ này và chuyển tiếp yêu cầu đến một instance đã xử lý cùng một tiền tố đó. Nếu instance đó vẫn còn giữ bộ nhớ đệm attention liên quan, mô hình có thể bỏ qua phần lớn công việc và tạo câu trả lời nhanh hơn.

Các điểm chính:

  • Không yêu cầu thay đổi mã nguồn – tính năng này nằm hoàn toàn ở lớp dịch vụ suy luận (inference service layer).
  • Chỉ áp dụng cho các mô hình tự lưu trữ (self-hosted models) – các dịch vụ được quản lý như API của OpenAI hoặc dịch vụ của Anthropic không bị ảnh hưởng.
  • Minh bạch đối với các ứng dụng – cùng một URL endpoint SageMaker và hợp đồng API (API contract) vẫn được giữ nguyên.

Những ai sẽ được hưởng lợi

Các doanh nghiệp lưu trữ LLM trên SageMaker thực hiện điều đó vì nhiều lý do, từ quyền riêng tư dữ liệu đến kiểm soát chi phí. Đối với những bên đang vận hành chatbot hỗ trợ, trợ lý bán hàng hoặc bất kỳ tác nhân tương tác nào sử dụng lặp đi lặp lại một prompt hệ thống cố định, việc tinh chỉnh định tuyến này có thể giảm thời gian phản hồi trung bình. Về mặt chi phí, mỗi lần trúng cache sẽ giúp GPU không phải đánh giá lại phần chung của prompt.

Các hạn chế và phản biện

Lợi ích phụ thuộc vào sự hiện diện của các tiền tố lặp lại. Các prompt có tính biến động cao—chẳng hạn như các truy vấn một lần hoặc các thông điệp hệ thống được tạo động—sẽ không thấy được lợi thế trúng cache tương tự.

Vì tính năng này bị giới hạn ở các triển khai tự lưu trữ, những khách hàng đang sử dụng các dịch vụ LLM được quản lý sẽ không thể tận dụng được nó.

Tóm lại: Định tuyến nhận biết tiền tố mang đến cho người dùng SageMaker một cách đơn giản, không cần viết mã để giảm thiểu độ trễ cho các khối lượng công việc LLM lặp đi lặp lại, đồng thời cắt giảm chi phí GPU. Đối với các tổ chức đã lưu trữ mô hình trên nền tảng này, bản nâng cấp này là một tinh chỉnh ít rủi ro, có thể chuyển hóa thành các tương tác người dùng nhanh hơn và hóa đơn thấp hơn.