llama.cpp Phát Hành Phiên Bản b11462 Cải Tiến Mã Nguồn Backend SYCL
Thư viện suy luận LLM mã nguồn mở llama.cpp đã phát hành bản dựng b11462, mang đến thay đổi nhỏ để làm sạch mã nguồn bộ đệm Key-Value (KV) Flash Attention trong backend SYCL thông qua yêu cầu kéo #27689. Mặc dù đây là một bản vá bảo trì định kỳ nhỏ, việc liên tục tinh chỉnh bộ đệm phần cứng backend giúp đảm bảo tính ổn định và khả năng bảo trì cho người dùng chạy mô hình trên phần cứng hỗ trợ SYCL như GPU Intel. Bản phát hành cung cấp các file thực thi (binary) biên dịch sẵn cho nhiều nền tảng như Linux, macOS, Windows, Android và các thiết bị Snapdragon. Ngoài ra, các bản dựng macOS hỗ trợ Arm KleidiAI vẫn bị vô hiệu hóa trong bản phát hành này.
## KIẾN THỨC NỀN
SYCL là một mô hình lập trình C++ chuẩn mở được thiết kế cho tính toán hỗn hợp (heterogeneous computing) trên nhiều bộ tăng tốc phần cứng khác nhau, bao gồm GPU Intel. Bộ đệm Key-Value (KV) là một kỹ thuật tối ưu hóa suy luận quan trọng trong các Mô hình Ngôn ngữ Lớn (LLM), giúp lưu trữ lại các giá trị attention để tránh tính toán trùng lặp trong quá trình sinh văn bản.