llama.cpp Phát Hành Phiên Bản 0.2.0 Với Đồng Bộ GGML Và Cập Nhật Kernel
Thư viện suy luận LLM cục bộ mã nguồn mở llama.cpp đã phát hành phiên bản 0.2.0. Bản cập nhật này đồng bộ hóa dự án với ggml phiên bản 0.21.0 và giới thiệu hỗ trợ kernel mới cho nhiều backend phần cứng khác nhau bao gồm Arm KleidiAI, SYCL, OpenCL và Vulkan. Là một thư viện quan trọng để chạy các mô hình ngôn ngữ lớn cục bộ, các phiên bản phát hành chính thức của llama.cpp đảm bảo độ ổn định tốt hơn và tối ưu hóa hiệu suất trên nhiều phần cứng khác nhau. Việc tích hợp các kernel tối ưu như KleidiAI của Arm và SYCL của Intel giúp mở rộng khả năng thực thi LLM hiệu quả trên các thiết bị biên và hệ thống không đồng nhất. Các cập nhật chính bao gồm việc thêm hỗ trợ kernel SME2 F32 GEMV thông qua KleidiAI cho kiến trúc Arm, thêm các kernel Q2_K và Q5_K cho SYCL, và triển khai các giải pháp khắc phục sự cố cho GPU Adreno trên OpenCL. Ngoài ra, bản phát hành còn giới thiệu tính năng tinh chỉnh CUDA cho quá trình chuyển đổi giải mã và tối ưu hóa Vulkan cho các phép tính lượng tử hóa.
## KIẾN THỨC NỀN
llama.cpp là một thư viện C/C++ mã nguồn mở phổ biến được thiết kế để suy luận LLM hiệu năng cao với thiết lập tối thiểu. Thư viện này dựa trên GGML, một thư viện tensor cấp thấp cho phép tính toán học máy hiệu quả trên phần cứng thông thường. KleidiAI là thư viện micro-kernel do Arm phát triển nhằm tối ưu hóa cho CPU Arm, trong khi SYCL là mô hình lập trình C++ đa nền tảng được sử dụng để lập trình cho các bộ xử lý không đồng nhất như GPU.