~/LLMS/cachyllama-a-llama-cpp-fork-with-persistent-ssd-backed-kv-cache-for

CachyLLama: Bản Fork llama.cpp Với KV Cache Lưu Trữ SSD Cho Các Agent Cục Bộ

CachyLLama là một bản fork mới của llama.cpp giới thiệu bộ nhớ đệm KV cache nhiều tầng lưu trên ổ cứng SSD và các điểm kiểm soát (checkpoint) prompt hệ thống. Điều này cho phép các hệ thống LLM cục bộ lưu và khôi phục trạng thái ngữ cảnh, loại bỏ việc phải xử lý lại các prompt dài ngay cả sau khi khởi động lại máy chủ. Trong các quy trình làm việc của agent LLM cục bộ, việc lặp lại các prompt hệ thống lớn và lịch sử trò chuyện trong mỗi yêu cầu gây ra độ trễ đáng kể. Bằng cách lưu trữ các trạng thái này trên SSD, CachyLLama giảm đáng kể thời gian phản hồi cho các truy vấn tiếp theo, giúp các phiên làm việc của agent cục bộ trở nên thực tế hơn trên phần cứng phổ thông. Thử nghiệm hiệu năng trên bộ xử lý 7840U cho thấy thời gian đánh giá prompt giảm từ 143,1 giây (lần đầu - cold) xuống chỉ còn 0,99 giây (lần sau - warm) đối với prompt khoảng 15.700 token. Ngoài ra, dự án cũng hỗ trợ các kiến trúc lai như Qwen và Gemma, vốn yêu cầu khôi phục trạng thái tuần hoàn phức tạp hơn.

## KIẾN THỨC NỀN

Các mô hình ngôn ngữ lớn (LLM) tạo văn bản theo từng token, yêu cầu mô hình phải xử lý toàn bộ ngữ cảnh phía trước ở mỗi bước. Bộ nhớ đệm Key-Value (KV cache) lưu trữ các tính toán trung gian của các token trước đó để tránh tính toán thừa, nhưng các triển khai tiêu chuẩn thường làm mất bộ nhớ đệm này khi phiên làm việc hoặc máy chủ kết thúc.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLMs#llama.cpp#KV Cache#Local AI#Performance Optimization

$ subscribe --daily

CachyLLama: Bản Fork llama.cpp Với KV Cache Lưu Trữ SSD Cho Các Agent Cục Bộ | Daily News