llama.cpp Phát Hành Bản Build b10999 Cập Nhật Tính Toán Độ Dài Ngữ Cảnh Tự Động
llama.cpp vừa phát hành bản build b10999, cập nhật pull request #28849 giúp tinh chỉnh cách tính toán độ dài ngữ cảnh tối đa khi tự động điều chỉnh với bộ nhớ đệm Key-Value (KV) hợp nhất. Bản phát hành này cập nhật các tệp thực thi biên dịch sẵn trên nhiều hệ điều hành và kiến trúc phần cứng khác nhau. Việc tính toán chính xác giới hạn cửa sổ ngữ cảnh cho bộ nhớ đệm KV hợp nhất giúp ngăn ngừa lỗi tràn bộ nhớ (out-of-memory) trong khi vẫn tối đa hóa khả năng sử dụng bộ nhớ khi chạy mô hình cục bộ. Cải tiến nhỏ này giúp người dùng chạy các LLM với ngữ cảnh dài đạt hiệu năng tối ưu trên RAM hệ thống hoặc GPU có dung lượng hạn chế. Bản phát hành này điều chỉnh cụ thể logic dung lượng ngữ cảnh theo PR #28849 khi sử dụng tự động điều chỉnh bộ nhớ đệm KV hợp nhất. Các tệp nhị phân được biên dịch sẵn cho macOS, iOS, Windows, Android và Linux với sự hỗ trợ từ các backend bao gồm CPU, CUDA 12/13, Vulkan, ROCm 10.0, OpenVINO và SYCL.
## KIẾN THỨC NỀN
llama.cpp là framework C/C++ mã nguồn mở phổ biến giúp chạy các mô hình ngôn ngữ lớn (LLM) cục bộ trên nhiều loại phần cứng khác nhau. Bộ nhớ đệm Key-Value (KV) lưu trữ các vector chú ý của các token trước đó để tránh tính toán lặp lại trong quá trình tạo văn bản, nhưng nó nhanh chóng trở thành điểm nghẽn bộ nhớ chính khi làm việc với cửa sổ ngữ cảnh dài. Tính năng tự động điều chỉnh ngữ cảnh (auto-fitting context) sẽ tự động xác định độ dài ngữ cảnh tối đa mà hệ thống có thể đáp ứng dựa trên dung lượng bộ nhớ khả dụng.