Phiên bản llama.cpp b10359 cập nhật backend WebGPU và sửa lỗi CI
Phiên bản b10359 của llama.cpp giới thiệu các bản sửa lỗi tích hợp liên tục (CI) nhỏ và các cập nhật gia tăng cho backend WebGPU. Những cập nhật chính bao gồm việc bổ sung hỗ trợ số nguyên 32-bit (i32) cho các thao tác sao chép (copy) và vô hiệu hóa ma trận phân nhóm (subgroup matrices) khi kích thước tối đa của ô khóa-giá trị (max_kv_tile) bằng không. Những cải tiến gia tăng này nâng cao tính ổn định và khả năng tương thích của backend WebGPU trên llama.cpp, giúp quá trình suy luận mô hình ngôn ngữ lớn trực tiếp trên trình duyệt web diễn ra mượt mà hơn. Điều này đảm bảo các nhà phát triển hướng tới triển khai AI trên nền tảng web sẽ gặp ít lỗi build hơn và có phạm vi kiểm thử hoạt động tốt hơn. Bản phát hành này giải quyết các lỗi CI từ các pull request #25025 và #25262, thử nghiệm một triển khai flash attention mới và kích hoạt bộ kiểm thử "all ops". Nó cũng cung cấp các tệp thực thi được biên dịch sẵn cho nhiều nền tảng bao gồm macOS, Linux, Windows (hỗ trợ CUDA 12/13, Vulkan, ROCm) và Android.
## KIẾN THỨC NỀN
llama.cpp là một thư viện phần mềm mã nguồn mở phổ biến được thiết kế để suy luận LLM hiệu quả trên phần cứng phổ thông bằng cách sử dụng thư viện tensor GGML. WebGPU là một tiêu chuẩn web và API hiện đại cho phép các ứng dụng web truy cập vào GPU của hệ thống để xử lý đồ họa hiệu năng cao và các tác vụ học máy trực tiếp trong trình duyệt.