llama.cpp Phát Hành Bản b10868 Hỗ Trợ Định Dạng Nén IQ Cho Mô Hình MoE
Bản phát hành b10868 của llama.cpp bổ sung khả năng xử lý định dạng nén IQ (Importance Matrix) cho các mô hình Mixture of Experts (MoE) thông qua PR #28476. Cập nhật này mang lại khả năng nén số bit thấp hiệu quả cho các kiến trúc MoE phức tạp, giúp người dùng chạy các mô hình thưa lớn ngay trên thiết bị cá nhân với mức tiêu thụ RAM và VRAM thấp hơn. Bản dựng tự động này bao gồm các tệp thực thi biên dịch sẵn cho nhiều hệ điều hành và nền tảng như macOS, Windows, Linux, Android, CUDA 12/13, Vulkan, ROCm và SYCL.
## KIẾN THỨC NỀN
llama.cpp là thư viện C/C++ phổ biến được thiết kế để chạy suy luận LLM cục bộ trên nhiều loại phần cứng khác nhau. Định lượng (quantization) giúp nén trọng số mô hình từ độ chính xác cao (như FP16) xuống số bit thấp hơn, trong đó phương pháp IQ (Importance Matrix) sử dụng dữ liệu hiệu chỉnh để duy trì chất lượng mô hình ở mức nén cực thấp. Mixture of Experts (MoE) là kiến trúc mạng thần kinh điều hướng các token đầu vào đến các mạng con chuyên biệt, giúp giảm chi phí tính toán so với các mô hình dày.