llama.cpp Phát Hành Bản b11389 Sửa Lỗi Tối Ưu Vulkan Cho AMD RDNA4
Phiên bản llama.cpp b11389 mang đến bản sửa lỗi tập trung cho việc tối ưu hóa kernel nhân ma trận-vector (mat_vec) khi chạy trên backend Vulkan dành cho kiến trúc GPU RDNA4 của AMD. Bản phát hành đồng thời cập nhật các tệp thực thi đóng gói sẵn trên tất cả hệ điều hành và kiến trúc được hỗ trợ. Bản vá này giúp cải thiện hiệu suất và độ ổn định khi chạy suy luận LLM cục bộ thông qua Vulkan trên các card đồ họa AMD Radeon thế hệ mới. Điều này phản ánh sự duy trì liên tục của dự án nhằm đảm bảo khả năng tương thích khi các kiến trúc GPU mới xuất hiện. Bản phát hành tích hợp pull request #29934, cụ thể là điều chỉnh các tham số tối ưu hóa phép nhân ma trận-vector trong backend Vulkan dành cho phần cứng RDNA4. Các bản dựng cập nhật đã sẵn sàng cho các nền tảng Linux, Windows, macOS, Android và iOS.
## KIẾN THỨC NỀN
llama.cpp là một công cụ mã nguồn mở viết bằng C/C++ được thiết kế để suy luận hiệu quả các Mô hình Ngôn ngữ Lớn (LLM) cục bộ trên phần cứng hiện đại. Dự án hỗ trợ nhiều backend tính toán như Vulkan, cho phép tăng tốc phần cứng đa nền tảng trên phần cứng của nhiều nhà cung cấp GPU khác nhau. RDNA4 là vi kiến trúc GPU của AMD được trang bị trên các dòng card đồ họa Radeon.