Bản phát hành llama.cpp b10907 khắc phục lỗi cấp phát KV cache cho kiến trúc Multi-Token Prediction
llama.cpp đã phát hành phiên bản sửa lỗi b10907, giúp khắc phục các sự cố liên quan đến việc cấp phát bộ nhớ đệm Key-Value (KV cache) trong ngữ cảnh Dự đoán đa Token (Multi-Token Prediction - MTP). Bản sửa lỗi này dành riêng cho các mô hình sử dụng kiến trúc DeepSeek-V2, GLM-4-MoE và Cohere-2-MoE. Việc cấp phát KV cache chính xác là yếu tố then chốt giúp ngăn ngừa lỗi bộ nhớ và sập ứng dụng khi thực hiện dự đoán đa token trên các mô hình Mixture-of-Experts (MoE) phức tạp. Bản sửa lỗi này đảm bảo hiệu năng suy luận cục bộ và giải mã suy đoán (speculative decoding) ổn định trên các dòng mô hình mã nguồn mở phổ biến. Bản phát hành này bổ sung cơ chế inverse architecture gating và bộ kiểm thử kiến trúc toàn diện để xử lý chính xác việc lọc lớp MTP. Thay đổi này đảm bảo các lớp hỗ trợ MTP cấp phát bộ nhớ chuẩn xác trong quá trình thiết lập ngữ cảnh trên các kiến trúc MoE được hỗ trợ.
## KIẾN THỨC NỀN
llama.cpp là một khung suy luận mã nguồn mở bằng C/C++ được thiết kế để chạy các mô hình ngôn ngữ lớn (LLM) hiệu quả trên phần cứng cục bộ. Dự đoán đa Token (Multi-Token Prediction - MTP) là kỹ thuật tối ưu hóa suy luận cho phép mô hình dự đoán đồng thời nhiều token tiếp theo thay vì sinh từng token một. KV cache lưu trữ các biểu diễn key và value của những token trước đó nhằm tránh phải tính toán lại bộ nhớ trong quá trình sinh văn bản.