Duy trì độ nóng cho Prefix Cache của vLLM giữa các lượt gọi AI Agent
Một thảo luận trong cộng đồng LLM tập trung vào các phương pháp giữ cho prefix cache của vLLM luôn hoạt động giữa các lượt tương tác nối tiếp trong quy trình của AI agent. Mục tiêu là ngăn chặn việc xóa bộ nhớ cache để không phải tính toán lại ngữ cảnh lặp đi lặp lại qua từng lượt của agent. Các AI agent đa bước thường xuyên gửi lại toàn bộ câu lệnh hệ thống dài và lịch sử tương tác, gây ra độ trễ lớn nếu key-value (KV) cache của prompt bị xóa giữa các lượt. Việc giữ prefix cache luôn 'nóng' giúp giảm đáng kể thời gian tạo token đầu tiên (TTFT) và tăng hiệu suất xử lý tổng thể cho các hệ thống agent phức tạp. Tính năng Automatic Prefix Caching của vLLM cho phép chia sẻ các block KV-cache giữa các yêu cầu có chung prefix, nhưng các khoảng nghỉ hoặc áp lực bộ nhớ GPU cao có thể giải phóng cache. Các phương pháp tối ưu hóa bao gồm gửi yêu cầu duy trì định kỳ, tùy chỉnh chính sách cấp phát cache, hoặc ghim các block prefix của agent trong bộ nhớ GPU.
## KIẾN THỨC NỀN
vLLM là một engine suy luận mã nguồn mở được thiết kế để phục vụ LLM với hiệu suất cao bằng cách sử dụng các công nghệ như PagedAttention để quản lý bộ nhớ hiệu quả. Tính năng Automatic Prefix Caching phát triển dựa trên cơ chế này bằng cách tái sử dụng các block key-value cache giữa các yêu cầu có chung các token đầu vào ban đầu.