~/LLAMA CPP/llama-cpp-release-b10902-adds-opencl-binary-kernel-support-for-a8-q4

llama.cpp Phát Hành Phiên Bản b10902 Bổ Sung Binary Kernel OpenCL Cho A8 Q4_0

Bản phát hành b10902 của llama.cpp bổ sung hỗ trợ binary kernel OpenCL cho phép nhân ma trận A8 Q4_0. Phiên bản này cũng phân phối các tệp binary được biên dịch sẵn cho macOS, Linux, Windows, Android và nhiều backend như CUDA, Vulkan, ROCm và OpenCL. Việc cung cấp các binary kernel OpenCL dành riêng cho định dạng định lượng 4-bit giúp nâng cao hiệu suất thực thi trên các phần cứng không phải NVIDIA, chẳng hạn như GPU Qualcomm Adreno hoặc chip đồ họa tích hợp. Điều này tiếp tục thúc đẩy mục tiêu của llama.cpp trong việc giúp suy luận LLM cục bộ nhanh hơn và dễ tiếp cận hơn trên các thiết bị đa dạng. Bản phát hành này tích hợp PR #28268, tập trung tối ưu hóa phép nhân ma trận với kích hoạt 8-bit và trọng số 4-bit (A8 Q4_0) trong OpenCL. Các gói binary đi kèm hỗ trợ CUDA 12/13, ROCm 10.0, OpenVINO, SYCL, Vulkan và Windows OpenCL Adreno, mặc dù tính năng KleidiAI trên macOS Apple Silicon vẫn tạm thời bị tắt.

## KIẾN THỨC NỀN

llama.cpp là một thư viện C/C++ mã nguồn mở phổ biến được thiết kế để suy luận hiệu quả các Mô hình Ngôn ngữ Lớn (LLM) trên phần cứng cá nhân. Các phương pháp định lượng như Q4_0 giúp giảm mức tiêu thụ bộ nhớ bằng cách lưu trữ tham số mô hình dưới dạng 4-bit thay vì số thực 16-bit. OpenCL là một nền tảng đa giao tiếp cho phép phần mềm thực thi các phép tính song song trên nhiều loại phần cứng khác nhau, bao gồm GPU di động và GPU tích hợp.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama.cpp#opencl#llm-inference#ai-infrastructure

$ subscribe --daily

llama.cpp Phát Hành Phiên Bản b10902 Bổ Sung Binary Kernel OpenCL Cho A8 Q4_0 | Daily News