llama.cpp v0.4.1 Phát Hành Hỗ Trợ Kiến Trúc Mô Hình Mới Và Cập Nhật Core GGML
llama.cpp đã phát hành phiên bản 0.4.1, mang đến sự hỗ trợ cho các kiến trúc mô hình mới bao gồm Maple 20B-A1B ternary MoE, Tencent Hy 4 và Spark2.5. Phiên bản này cũng cập nhật công cụ ggml nền tảng lên v0.24.0, bổ sung khả năng khôi phục trạng thái tuần hoàn (recurrent-state rollback) cho Kimi-K3 và thêm cờ chuyển đổi GGUF `--fuse-qkv`. Bản cập nhật này mở rộng khả năng suy luận LLM cục bộ sang các kiến trúc mô hình kết hợp và ternary Mixture-of-Experts (MoE) mới xuất hiện, đồng thời nâng cao hiệu suất giải mã suy đoán (speculative decoding). Ngoài ra, việc hợp nhất các cờ bộ nhớ và cập nhật thư viện cốt lõi giúp cải thiện độ ổn định hiệu năng trên các thiết bị rìa và iGPU. Các thay đổi vận hành đáng chú ý bao gồm việc loại bỏ các cờ `--mmap`, `--mlock` và `--direct-io` để thay bằng `--load-mode`, đồng thời tắt mặc định tính năng tải tensor lười (lazy loading) trên iGPU. API cũng cập nhật `llama_sampler_chain_n()` trả về kiểu `int32_t`, tái cấu trúc xử lý JSON schema thông qua `common_schema` và bổ sung tính năng ghi log JSONL có cấu trúc.
## KIẾN THỨC NỀN
llama.cpp là một framework C/C++ nguồn mở được thiết kế cho việc suy luận LLM hiệu năng cao và nhẹ trên nhiều nền tảng phần cứng khác nhau bằng cách sử dụng các mô hình GGUF đã lượng hóa. Framework này dựa vào thư viện tensor ggml làm công cụ thực thi cốt lõi cho các tính toán ma trận cấp thấp. Các kiến trúc LLM hiện đại thường tận dụng kỹ thuật định tuyến Mixture-of-Experts (MoE) và các trạng thái tuần hoàn để đạt dung lượng bộ nhớ tối ưu và tốc độ tạo văn bản nhanh hơn.