~/LLAMA CPP/llama-cpp-release-b11460-adds-iq3-s-multi-column-mmvq-to-sycl

llama.cpp Bản Phát Hành b11460 Bổ Sung IQ3_S Multi-Column MMVQ Cho SYCL Backend

Bản phát hành b11460 của llama.cpp bổ sung hỗ trợ các kernel IQ3_S multi-column MMVQ (Matrix-Vector Multiplication Quantized) cho backend SYCL. Bản cập nhật này cũng đi kèm các tệp thực thi biên dịch sẵn trên nhiều nền tảng như Linux, Windows, macOS, Android và Snapdragon. Cập nhật này giúp cải thiện hiệu năng suy luận cho các mô hình định dạng định lượng 3-bit IQ3_S trên các kiến trúc phần cứng được tăng tốc qua SYCL, chẳng hạn như GPU Intel. Điều này tiếp nối nỗ lực tối ưu hóa hiệu năng định lượng bit thấp trên các backend phần cứng ngoài CUDA. Bản phát hành tích hợp PR #29500, mở rộng luồng xử lý MMVQ của SYCL backend để hỗ trợ phép nhân ma trận - vectơ đa cột cho tensor định lượng IQ3_S. Các bản đóng gói sẵn tiếp tục hỗ trợ nhiều bộ thực thi tăng tốc như CUDA 12/13, ROCm, Vulkan, OpenVINO và SYCL.

## KIẾN THỨC NỀN

llama.cpp là một thư viện C/C++ phổ biến được thiết kế để suy luận mô hình ngôn ngữ lớn (LLM) cục bộ nhanh chóng trên nhiều kiến trúc phần cứng. SYCL là một chuẩn mở do Khronos Group dẫn đầu cho lập trình dị thể, thường được sử dụng để tăng tốc các công việc tính toán trên phần cứng Intel thông qua oneAPI. IQ3_S là phương pháp định lượng dựa trên ma trận tầm quan trọng (i-quant) trong llama.cpp giúp nén trọng số mô hình xuống còn khoảng 3 bit mỗi tham số mà vẫn duy trì độ chính xác cao.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama-cpp#llm-inference#sycl#open-source-ai

$ subscribe --daily

llama.cpp Bản Phát Hành b11460 Bổ Sung IQ3_S Multi-Column MMVQ Cho SYCL Backend | Daily News