llama.cpp Phát Hành Phiên Bản b11039 Cải Tiến Cơ Chế Sliding Window Attention Và Model-Saver
llama.cpp đã phát hành bản b11039, cập nhật logic nạp và lưu mô hình để đọc và ghi chính xác các mẫu Sliding Window Attention (SWA) trên 15 kiến trúc được hỗ trợ. Bản cập nhật bổ sung hàm llama_model_base::load_swa_pattern() và tuần tự hóa các tham số Multi-Head Latent Attention (MLA) cho các lớp SWA. Bản phát hành này bảo đảm khả năng lưu và nạp lại mô hình chính xác tuyệt đối (bit-exact roundtrip) cho các kiến trúc sử dụng SWA và MLA như Gemma 3, Cohere 2 và OLMo 2. Việc đảm bảo các cấu hình SWA theo từng lớp không bị bỏ qua hoặc làm sai lệch khi chuyển đổi giúp tránh giảm chất lượng suy luận trong các tệp mô hình GGUF. Trình lưu mô hình được cập nhật ghi sliding_window_pattern rõ ràng dưới dạng mảng cờ cho từng lớp thay vì nén thành một chu kỳ vô hướng. Nó cũng tuần tự hóa độ dài key/value MLA và rank KV LoRA cần thiết cho các mô hình như dots3note, giúp vượt qua bài kiểm tra roundtrip chính xác từng bit trên 15 kiến trúc.
## KIẾN THỨC NỀN
Sliding Window Attention (SWA) giới hạn tính toán self-attention trong một cửa sổ ngữ cảnh cố định quanh mỗi token, giảm chi phí tính toán bậc hai của kiến trúc Transformer truyền thống xuống mức tuyến tính. Multi-Head Latent Attention (MLA) sử dụng chiếu nấc thấp (low-rank projection) để nén dung lượng bộ nhớ Key-Value (KV) cache, giúp các mô hình ngôn ngữ lớn xử lý ngữ cảnh dài hiệu quả hơn.