llama.cpp Phát Hành Phiên Bản b10180 Giới Thiệu Các Tối Ưu Hóa SYCL
Dự án llama.cpp đã phát hành phiên bản build b10180, giới thiệu các tối ưu hóa SYCL bao gồm một đường dẫn nhanh liền kề (contiguous fast path) và toán học chỉ mục 32-bit cho các phép toán phần tử đơn phân (unary elementwise operations). Bản cập nhật cũng tích hợp fastdiv để tối ưu hóa việc tính toán chỉ mục phần tử. Các tối ưu hóa này giúp cải thiện hiệu suất trên các bộ tăng tốc phần cứng hỗ trợ mô hình lập trình SYCL, đặc biệt là GPU của Intel. Điều này thể hiện nỗ lực liên tục nhằm tăng cường khả năng tăng tốc GPU đa nền tảng để chạy các mô hình ngôn ngữ lớn cục bộ. Bản phát hành này nhắm mục tiêu cụ thể vào các phép toán phần tử đơn phân bằng cách sử dụng toán học chỉ mục 32-bit và fastdiv để tăng tốc độ tính toán. Ngoài ra, một số bản dựng như macOS Apple Silicon kích hoạt KleidiAI và các bản dựng openEuler vẫn bị vô hiệu hóa trong phiên bản này.
## KIẾN THỨC NỀN
llama.cpp là một thư viện phần mềm mã nguồn mở phổ biến cho phép chạy các mô hình ngôn ngữ lớn (LLM) cục bộ với hiệu suất cao trên nhiều nền tảng phần cứng khác nhau. SYCL là một mô hình lập trình C++ đa nền tảng, miễn phí bản quyền do Khronos Group phát triển để lập trình cho các bộ tăng tốc không đồng nhất như GPU. KleidiAI là một thư viện phần mềm do Arm phát triển nhằm tối ưu hóa hiệu suất AI đặc biệt trên CPU Arm.