Bản phát hành llama.cpp b11424 sửa lỗi bộ nhớ chia sẻ trong Vulkan Flash Attention
Khung làm việc suy luận LLM nguồn mở llama.cpp đã phát hành bản dựng b11424, khắc phục lỗi ghi ngoài phạm vi bộ nhớ chia sẻ (#29988). Bản sửa lỗi này giải quyết tính ổn định và độ chính xác trong triển khai Flash Attention trên backend Vulkan. Ghi bộ nhớ ngoài phạm vi có thể gây ra sự cố trình điều khiển, hỏng bộ nhớ hoặc lỗi số liệu thầm lặng trong quá trình suy luận mô hình trên các GPU hỗ trợ Vulkan. Việc khắc phục sự cố này giúp đảm bảo Flash Attention thực thi an toàn và tin cậy hơn cho người dùng chạy mô hình ngôn ngữ lớn qua tăng tốc phần cứng Vulkan. Bản phát hành bao gồm các tệp thực thi biên dịch sẵn trên nhiều nền tảng như Linux, Windows, macOS, Android và thiết bị Snapdragon hỗ trợ backend CUDA, ROCm, SYCL và Vulkan. Đáng chú ý, tính năng tích hợp KleidiAI trên macOS vẫn tạm thời bị vô hiệu hóa trong bản dựng này.
## KIẾN THỨC NỀN
llama.cpp là một thư viện C/C++ nguồn mở phổ biến được thiết kế để suy luận cục bộ hiệu quả các Mô hình Ngôn ngữ Lớn (LLM) trên nhiều nền tảng phần cứng khác nhau. Flash Attention là thuật toán chú ý tối ưu bộ nhớ giúp tăng tốc đáng kể quá trình suy luận mô hình transformer và giảm mức tiêu thụ bộ nhớ. Vulkan là một API đồ họa và tính toán đa nền tảng cho phép llama.cpp tận dụng tăng tốc GPU trên các bộ xử lý đồ họa tích hợp hoặc phần cứng không thuộc NVIDIA.