Amazon Bedrock hiện cho phép các nhà phát triển lưu bộ nhớ đệm (cache) các phần của một prompt, giúp giảm hóa đơn sử dụng token lên đến 90% và cắt giảm độ trễ phản hồi tới 85% cho các ứng dụng có sử dụng lại một tiền tố prompt cố định.
Tại sao thay đổi này lại quan trọng
Việc chạy các mô hình ngôn ngữ lớn theo yêu cầu sẽ tiêu tốn chi phí mỗi khi các token được gửi đến mô hình. Các chatbot, trợ lý mã nguồn và công cụ tìm kiếm tài liệu thường gửi lại cùng một hướng dẫn hệ thống hoặc tài liệu tham khảo, làm tăng chi phí và làm chậm tốc độ phản hồi.
Cách thức hoạt động của prompt caching
Bedrock bổ sung một cờ "cacheable" (có thể lưu bộ nhớ đệm) mà các nhà phát triển có thể gắn vào bất kỳ phân đoạn nào của prompt—thường là các hướng dẫn cấp hệ thống, các tài liệu nền dài, hoặc các định nghĩa công cụ không bao giờ thay đổi trong suốt một phiên làm việc. Khi một yêu cầu đến, Bedrock sẽ kiểm tra xem phân đoạn được gắn cờ có khớp với một mục đã lưu trữ hay không. Nếu khớp, dịch vụ sẽ bỏ qua bước mã hóa lại và chạy lại phần đó qua mô hình, thay vào đó sẽ lấy bản biểu diễn đã được tính toán trước từ bộ nhớ đệm.
Các con số cụ thể
- Chi phí token đầu vào: giảm tới 90% vì tiền tố được lưu trong bộ nhớ đệm sẽ không còn tiêu tốn token trong mỗi lần gọi.
- Độ trễ: nhanh hơn tới 85% vì mô hình không cần phải xử lý nặng phần nội dung tĩnh.
Các kịch bản phù hợp nhất
Tính năng này phát huy hiệu quả nhất khi prompt chứa một khối nội dung lớn, không thay đổi, theo sau là một truy vấn ngắn và biến đổi của người dùng. Các mô hình phổ biến bao gồm:
- Các luồng Retrieval-augmented generation (RAG) chèn một tài liệu được truy xuất vào trước mỗi truy vấn.
- Các bot hỗ trợ khách hàng luôn bắt đầu với cùng một tuyên bố chính sách hoặc văn bản thiết lập tông giọng.
- Các trợ lý lập trình tải một định nghĩa công cụ ngôn ngữ cố định trước đoạn mã của nhà phát triển.
Những gì nhà phát triển cần thay đổi
Các nhà phát triển phải sắp xếp lại prompt sao cho nội dung tĩnh nằm ở ngay đầu tiên và phải giống hệt nhau từng byte qua các lần gọi. Đầu vào biến đổi của người dùng sẽ theo sau tiền tố đã được lưu trong bộ nhớ đệm. Không cần phải chuyển đổi mô hình; các endpoint Bedrock tương tự sẽ xử lý yêu cầu.
Ai được lợi, ai cần lưu ý
Lợi ích này chỉ áp dụng cho các khối lượng công việc mà tiền tố thực sự giữ nguyên trạng thái tĩnh. Các ứng dụng cá nhân hóa hướng dẫn hệ thống cho từng người dùng hoặc thường xuyên thay đổi ngữ cảnh sẽ thấy ít lợi ích và phải cân nhắc giữa sự phức tạp tăng thêm khi thiết lập prompt với những lợi ích khiêm tốn thu được.
Tóm lại: Prompt caching cung cấp cho người dùng Bedrock một đòn bẩy đơn giản để cắt giảm chi phí vận hành AI và cải thiện thời gian phản hồi, miễn là các ứng dụng của họ có thể tách biệt được một tiền tố prompt có thể tái sử dụng.
