llama.cpp Phát Hành Bản b11439 Tái Cấu Trúc Khả Năng Sao Chép Chuyên Gia Trong ggml
Dự án mã nguồn mở llama.cpp đã phát hành phiên bản b11439, tái cấu trúc logic sao chép chuyên gia (selective expert copying) sang mã người dùng trong thư viện ggml. Ngoài ra, bản cập nhật này bổ sung mô hình DeepSeek-V2 vào bộ kiểm thử tự động cho tính năng sao chép chuyên gia. Việc tái cấu trúc này giúp cải thiện tính đóng gói và khả năng bảo trì trong API backend của ggml khi xử lý các kiến trúc Mixture-of-Experts (MoE). Việc đưa các mô hình như DeepSeek-V2 vào bộ kiểm thử tự động giúp đảm bảo độ ổn định cao hơn khi suy luận các mô hình MoE trên nhiều backend phần cứng. Bản cập nhật tinh chỉnh giao diện backend và các chú thích trong file `ggml-backend.h` để cung cấp thao tác sao chép chuyên gia cho trình gọi bên ngoài. Các bộ kiểm thử tự động đã được sửa đổi để đăng ký hai mô hình, trong đó sử dụng DeepSeek2 để xác minh chức năng sao chép chọn lọc.
## KIẾN THỨC NỀN
llama.cpp là một framework C/C++ mã nguồn mở phổ biến giúp chạy các mô hình LLM hiệu quả trên phần cứng tiêu dùng dựa trên thư viện tensor ggml. Các kiến trúc Mixture-of-Experts (MoE) như DeepSeek-V2 định tuyến dữ liệu tới các mạng con chuyên biệt (gọi là expert), đòi hỏi các cơ chế sao chép và quản lý bộ nhớ được tối ưu riêng.