Phiên bản llama.cpp b10642 bổ sung tính năng theo dõi ID token vào ô KV
Dự án llama.cpp đã phát hành phiên bản b10642, giới thiệu tính năng theo dõi ID token trực tiếp vào ô Key-Value (KV). Bản cập nhật này bao gồm việc bổ sung hàm `get_prev_tokens` để quản lý và truy xuất các token trước đó. Việc theo dõi ID token trong bộ nhớ đệm KV (KV cache) rất quan trọng để tối ưu hóa việc sử dụng bộ nhớ và quản lý lịch sử ngữ cảnh trong quá trình suy luận LLM. Bản cập nhật gia tăng này giúp đặt nền móng cho việc xử lý và truy xuất ngữ cảnh hiệu quả hơn trong các môi trường hạn chế tài nguyên. Bản phát hành này triển khai pull request #27762, giúp theo dõi ID token trong ô KV và thêm một hàm bổ trợ để truy xuất các token trước đó. Ngoài ra, bản phát hành này bao gồm các tệp thực thi được biên dịch sẵn cho nhiều nền tảng, mặc dù macOS Apple Silicon với KleidiAI được kích hoạt vẫn bị vô hiệu hóa.
## KIẾN THỨC NỀN
Bộ nhớ đệm Key-Value (KV cache) là một kỹ thuật tối ưu hóa quan trọng trong quá trình suy luận Mô hình Ngôn ngữ Lớn (LLM), giúp lưu trữ các trạng thái key và value đã tính toán trước đó nhằm tránh các phép tính toán thừa. llama.cpp là một dự án mã nguồn mở phổ biến được thiết kế để suy luận LLM hiệu quả trên phần cứng tiêu dùng, bao gồm cả CPU và GPU. Việc quản lý bộ nhớ đệm KV hiệu quả là rất cần thiết khi độ dài ngữ cảnh tăng lên, vì dung lượng bộ nhớ của nó tăng tuyến tính theo kích thước ngữ cảnh.