~/LLAMA CPP/llama-cpp-release-b10662-introduces-unified-kv-cache-configuration-argument

Bản phát hành llama.cpp b10662 giới thiệu tham số cấu hình KV Cache hợp nhất

Dự án llama.cpp đã phát hành phiên bản b10662, giới thiệu tham số máy chủ `--kv-unified-per-slot` (hoặc `ctx-per-slot`). Bản cập nhật này tái cấu trúc cấu hình KV cache hợp nhất bằng cách thay thế các phân số ngữ cảnh bằng các slot pool ngữ cảnh dưới dạng số nguyên. Quản lý KV cache hiệu quả là yếu tố quan trọng để giảm nghẽn cổ chai bộ nhớ trong quá trình suy luận LLM, đặc biệt là trong các kịch bản máy chủ phục vụ nhiều người dùng. Thay đổi này đơn giản hóa cách các nhà phát triển phân bổ bộ nhớ ngữ cảnh cho mỗi slot, giúp cải thiện độ ổn định và hiệu suất của máy chủ llama.cpp. Yêu cầu kéo (pull request #24124) được đồng tác giả bởi Nguyễn Xuân Sơn từ Hugging Face và tái cấu trúc cấu hình để chuyển `ctx-per-slot` thành một số nguyên. Ngoài ra, bản phát hành này tạm thời vô hiệu hóa tính năng tăng tốc KleidiAI cho macOS Apple Silicon trong các bản dựng mặc định.

## KIẾN THỨC NỀN

Trong quá trình suy luận LLM, KV cache lưu trữ các key và value của các token trước đó để tránh tính toán lại, nhưng nó lại là nguyên nhân chính gây nghẽn bộ nhớ. Llama.cpp là một công cụ suy luận mã nguồn mở phổ biến được thiết kế để chạy các LLM hiệu quả trên phần cứng tiêu dùng và máy chủ.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama.cpp#LLM Inference#Open Source#AI Infrastructure

$ subscribe --daily

Bản phát hành llama.cpp b10662 giới thiệu tham số cấu hình KV Cache hợp nhất | Daily News