Công cụ mới "cache-pressure" giúp kiểm tra việc giải phóng bộ nhớ KV Cache trên LLM local
Nhà phát triển "co-l" đã phát hành `cache-pressure`, một công cụ mã nguồn mở và giao thức xác minh nhằm kiểm thử tải các engine phục vụ LLM cục bộ như vLLM, llama.cpp và SGLang dưới áp lực ngữ cảnh. Công cụ này hiệu chuẩn các kỳ vọng trúng/trượt cache, nạp ngữ cảnh để lấp đầy bộ nhớ và đo lường chính xác mức độ giữ lại cũng như hành vi giải phóng KV cache thực tế. Dung lượng KV cache được công bố bởi các engine suy luận thường khác biệt so với số lượng token thực tế được giữ lại khi bộ nhớ bị lấp đầy. Công cụ này cung cấp cho các nhà phát triển và nhà bảo trì engine kết quả thực tế để đánh giá hiệu năng, xác minh các bản sửa lỗi bộ nhớ đệm và tối ưu hóa cấu hình phục vụ. Trong các thử nghiệm ban đầu trên vLLM, việc áp dụng các bản vá lỗi khử trùng lặp và giới hạn cụ thể đã giúp tăng tỷ lệ giữ lại ngữ cảnh từ 51,98% (1,05 triệu token) lên 146,56% (3,00 triệu token) so với dung lượng 2 triệu được công bố. Quy trình xác minh hoạt động bằng cách nạp đầy cache bằng các ngữ cảnh ổn định và dò tìm theo thứ tự ngược để xác định chính xác thời điểm và ngữ cảnh cũ nào bị giải phóng.
## KIẾN THỨC NỀN
Trong quá trình suy luận Mô hình Ngôn ngữ Lớn (LLM), bộ nhớ đệm Key-Value (KV cache) lưu trữ các trạng thái chú ý trung gian của các token đã xử lý để tránh tính toán lại dư thừa trong khi sinh văn bản. Các framework phục vụ như vLLM sử dụng các thuật toán quản lý bộ nhớ hiệu năng cao để quản lý các bộ nhớ đệm này, nhưng khi đạt đến giới hạn VRAM, các chính sách giải phóng cache (eviction policies) sẽ quyết định ngữ cảnh nào bị xoá khỏi bộ nhớ.