CachyLLama: Bản fork của llama.cpp hỗ trợ lưu bộ nhớ đệm KV trên ổ cứng SSD
CachyLLama là một bản fork mới của llama.cpp được thiết kế để tăng tốc các luồng công việc của tác nhân AI cục bộ bằng cách triển khai bộ nhớ đệm Key-Value (KV) liên tục trên ổ cứng SSD và quản lý trạng thái đa tầng. Nó cho phép các trạng thái đánh giá prompt tồn tại qua các lần khởi động lại hệ thống và giảm đáng kể thời gian khởi động ấm cho các prompt lớn. Các luồng công việc của tác nhân cục bộ thường gặp phải độ trễ cao do việc đánh giá lại liên tục các prompt hệ thống và lịch sử trò chuyện. Bằng cách lưu các trạng thái này vào đĩa cứng, CachyLLama loại bỏ chi phí xử lý dư thừa, giúp việc chạy LLM cục bộ trở nên khả thi và nhanh chóng trên phần cứng tầm trung và APU. Công cụ này hỗ trợ các kiến trúc lai MoE/SSM như DeepSeek-V3 và Qwen 3.5, với các thử nghiệm hiệu năng cho thấy tốc độ xử lý prompt tăng từ 143,1 giây (khởi động lạnh) xuống còn 0,99 giây (đã lưu đệm) đối với prompt dài 15.700 token. Tuy nhiên, nó chỉ tăng tốc quá trình xử lý prompt chứ không tăng tốc độ tạo token thực tế.
## KIẾN THỨC NỀN
Bộ nhớ đệm Key-Value (KV) là một kỹ thuật được sử dụng trong suy luận LLM để lưu trữ các trạng thái attention đã được tính toán trước đó, tránh việc phải tính toán lại chúng cho mỗi token mới. Trong các luồng công việc của tác nhân (agent), nơi các hướng dẫn hệ thống và lịch sử trò chuyện được gửi liên tục đến mô hình, việc tính toán lại các token này (đánh giá prompt) thường là điểm nghẽn chính.