llama.cpp v0.3.0 ra mắt, hỗ trợ GLM-4.5-Air và DeepSeek 4
Phiên bản llama.cpp v0.3.0 đã được phát hành, mang đến khả năng hỗ trợ mô hình đa phương thức dots3-note với bộ nhớ đệm DSA-ISWA KV mới và tính năng Dự đoán đa mã thông báo (MTP) cho GLM-4.5-Air. Bản cập nhật này cũng sửa lỗi phân tách tensor và rollback đa chuỗi cho DeepSeek 4, đồng thời nâng cấp thư viện ggml lên phiên bản v0.22.0. Bản phát hành này nâng cao khả năng suy luận LLM cục bộ bằng cách tích hợp hỗ trợ cho các mô hình tiên tiến như GLM-4.5-Air và DeepSeek 4. Việc nâng cấp lên ggml v0.22.0 giúp cải thiện hiệu suất và tối ưu hóa phần cứng, đặc biệt là đối với người dùng Apple Silicon thông qua việc biên dịch song song các nhân Metal. Bản cập nhật giới thiệu loại bộ nhớ đệm DSA-ISWA KV mới cho dots3-note và kích hoạt chế độ phân tách tensor thông qua cờ `-sm tensor` cho DeepSeek 4. Ngoài ra, việc nâng cấp lên ggml v0.22.0 mang lại khả năng phân tách tensor meta-backend và phép toán `ggml_clamp` không ghi đè trực tiếp (non-in-place).
## KIẾN THỨC NỀN
llama.cpp là một thư viện mã nguồn mở C/C++ phổ biến được thiết kế để suy luận LLM cục bộ hiệu quả, sử dụng thư viện tensor ggml để tối ưu hóa hiệu suất trên phần cứng phổ thông. Bộ nhớ đệm KV (Key-Value) là kỹ thuật giúp tăng tốc độ tạo văn bản của LLM bằng cách lưu trữ các trạng thái attention trước đó, trong khi Dự đoán đa mã thông báo (MTP) cho phép các mô hình dự đoán đồng thời nhiều mã thông báo tiếp theo để đẩy nhanh quá trình giải mã.