llama.cpp phát hành phiên bản b10919 nâng cấp backend WebGPU với thư viện Google Dawn mới hơn
llama.cpp đã phát hành phiên bản vá b10919, cập nhật backend ggml-webgpu để tương thích với phiên bản mới hơn của thư viện Google Dawn. Bản phát hành này cũng bao gồm các điều chỉnh bảo trì nhỏ, bao gồm việc loại bỏ quét module cho backend WebGPU. Việc giữ backend WebGPU đồng bộ với các bản cập nhật của Google Dawn giúp duy trì độ ổn định, hiệu năng và khả năng tương thích phần cứng khi chạy các mô hình ngôn ngữ lớn trong môi trường WebGPU. Điều này đảm bảo các nhà phát triển sử dụng llama.cpp để suy luận AI trên web có thể tận dụng những cải tiến mới nhất của API cấp thấp. Thay đổi chính được thực hiện trong Pull Request #28683 bởi nhà đóng góp Masashi Yoshimura. Các tệp thực thi biên dịch sẵn cho b10919 đã được phát hành trên nhiều nền tảng như Windows, macOS, Linux, iOS và Android, hỗ trợ nhiều backend tính toán khác nhau như CUDA, Vulkan, ROCm, SYCL và OpenVINO.
## KIẾN THỨC NỀN
llama.cpp là một thư viện C/C++ mã nguồn mở hiệu năng cao được thiết kế để chạy suy luận mô hình ngôn ngữ lớn (LLM) cục bộ trên nhiều kiến trúc phần cứng khác nhau. Google Dawn là một bản triển khai mã nguồn mở, đa nền tảng của tiêu chuẩn WebGPU, cung cấp các giao diện C/C++ native cho GPU API nhằm giúp các trình duyệt web và ứng dụng chạy tác vụ đồ họa và tính toán hiệu năng cao.