Bản phát hành llama.cpp b11480 bổ sung bộ nhớ đệm GPU cho các chuyên gia MoE lưu trên RAM máy chủ
Bản phát hành b11480 của llama.cpp giới thiệu cơ chế lưu bộ nhớ đệm trên GPU cho các tham số thuộc mô hình Mixture of Experts (MoE) được giữ trong bộ nhớ hệ thống (RAM). Cập nhật này sử dụng `llama_moe_cache_ptr` để tối ưu hóa việc truy xuất các chuyên gia trong quá trình suy luận. Việc chạy các mô hình MoE lớn thường yêu cầu đẩy bớt các lớp chuyên gia sang RAM hệ thống do giới hạn dung lượng VRAM của GPU. Bằng cách lưu tạm các chuyên gia hay được kích hoạt ngay trên GPU, llama.cpp giúp giảm tắc nghẽn truyền dữ liệu qua băng thông PCIe và cải thiện tốc độ tạo văn bản. Tối ưu hóa này được tích hợp qua PR #29887, bổ sung cơ chế quản lý con trỏ động cho các chuyên gia MoE nằm ở bộ nhớ hệ thống. Các tệp thực thi dựng sẵn đã được phát hành cho nhiều nền tảng như macOS, Linux (CUDA, Vulkan, ROCm, SYCL), Windows, Android và phần cứng Snapdragon.
## KIẾN THỨC NỀN
Mixture of Experts (MoE) là một kiến trúc LLM mà trong đó chỉ một phần các mạng con chuyên biệt (gọi là chuyên gia) được định tuyến để xử lý từng token. Vì chỉ một phần nhỏ tổng trọng số mô hình được kích hoạt cho mỗi token, việc đẩy các chuyên gia chưa dùng sang bộ nhớ CPU cho phép người dùng chạy được các mô hình cực lớn vốn không thể chứa vừa trong VRAM.