llama.cpp Phát Hành Bản b11493 Bổ Sung Grouped MoE XMX GEMM Cho Backend Intel SYCL
Bản dựng b11493 của llama.cpp bổ sung các tối ưu hóa nhân GEMM XMX cho mô hình MoE (Mixture of Experts) dạng nhóm dành cho backend Intel SYCL. Bản cập nhật này đi kèm với các tệp thực thi biên dịch sẵn được cập nhật cho nhiều hệ điều hành và nền tảng bao gồm Linux, Windows, macOS và Android. Các nhân GEMM dạng nhóm giúp tăng tốc đáng kể quá trình suy luận mô hình ngôn ngữ lớn theo kiến trúc Mixture-of-Experts bằng cách xử lý nhiều phép nhân ma trận trên các expert trong một lần thực thi duy nhất. Cải tiến này giúp người dùng chạy GPU Intel qua SYCL đạt hiệu suất cao hơn khi vận hành các mô hình MoE như Mixtral hay DeepSeek. Pull request (#29245) khai thác các nhân phần cứng Xe Matrix Extensions (XMX) của Intel thông qua backend SYCL để thực hiện các phép toán ma trận song song cho việc định tuyến token trong mô hình MoE. Các bản biên dịch sẵn cũng được làm mới trên CUDA 12/13, ROCm, Vulkan, OpenVINO, SYCL FP16/FP32 và Snapdragon.
## KIẾN THỨC NỀN
SYCL là mô hình lập trình chuẩn mở dựa trên C++ do Khronos Group phát triển, cho phép tính toán dị thể trên nhiều bộ tăng tốc phần cứng như GPU Intel. Intel Xe Matrix Extensions (XMX) là các nhân tính toán ma trận chuyên dụng bằng phần cứng tích hợp trong GPU Intel để tăng tốc tác vụ AI. Mô hình Mixture-of-Experts (MoE) định tuyến các token đến nhiều mạng con (expert) khác nhau, đòi hỏi các hàm GEMM dạng nhóm để xử lý song song nhiều phép toán ma trận hiệu quả.