Bản phát hành llama.cpp b10172 sửa lỗi WebGPU và độ lệch bộ đệm
Dự án llama.cpp đã phát hành bản dựng b10172, mang đến các bản sửa lỗi cho backend ggml-webgpu. Các cập nhật quan trọng bao gồm giải quyết lỗi căn chỉnh cho độ lệch bộ đệm (buffer offset) lớn hơn 4GB, sửa lỗi độ lệch chế độ xem (view offset) và khắc phục các sự cố liên kết bí danh (binding alias) để hỗ trợ tất cả các kiến trúc. Các bản sửa lỗi này cải thiện tính ổn định và khả năng tương thích khi chạy các mô hình ngôn ngữ lớn cục bộ trên trình duyệt web bằng WebGPU, đặc biệt là khi xử lý các mô hình lớn vượt quá giới hạn bộ nhớ 4GB. Điều này đảm bảo việc thực thi LLM đa nền tảng mượt mà hơn trên nhiều kiến trúc phần cứng khác nhau. Bản phát hành này giải quyết các trường hợp biên trong `set_rows`, bổ sung biến thể GLU chồng chéo và tạm thời bỏ qua một số mô hình bị lỗi như DeepSeek-32 để dọn dẹp hạ tầng theo dõi. Ngoài ra, bản dựng macOS Apple Silicon kích hoạt KleidiAI đã bị vô hiệu hóa trong bản phát hành này.
## KIẾN THỨC NỀN
llama.cpp là một bản chuyển thể mã nguồn mở phổ biến của mô hình LLaMA từ Meta bằng ngôn ngữ C/C++, được thiết kế để suy luận LLM cục bộ hiệu quả. WebGPU là một tiêu chuẩn web hiện đại cho phép các ứng dụng web thực hiện tính toán GPU hiệu năng cao trực tiếp trong trình duyệt, và ggml-webgpu đóng vai trò là backend giúp llama.cpp tận dụng công nghệ này. KleidiAI là một thư viện mã nguồn mở do Arm phát triển nhằm tối ưu hóa các tác vụ AI trên CPU Arm.