~/LLAMA CPP/llama-cpp-release-b10721-fixes-webgpu-backend-crashes

Bản phát hành llama.cpp b10721 sửa lỗi sập nguồn trên WebGPU backend

Dự án llama.cpp đã phát hành phiên bản b10721, bao gồm bản sửa lỗi nhằm ngăn chặn tình trạng sập nguồn (crash) trong WebGPU backend. Cụ thể, bản vá này giải quyết sự cố trong hàm ggml_backend_tensor_get() khi độ lệch tensor (tensor offset) không phải là bội số của bốn. Bản vá này cải thiện độ ổn định khi chạy các mô hình ngôn ngữ lớn trong trình duyệt web và các môi trường sử dụng WebGPU để tăng tốc phần cứng. Nó giúp đảm bảo hiệu suất suy luận mượt mà hơn và ngăn ngừa các lỗi sập ứng dụng ngoài ý muốn trong quá trình xử lý tensor. Bản sửa lỗi giải quyết các ràng buộc căn chỉnh bộ nhớ trong WebGPU bằng cách xử lý các độ lệch không phải bội số của bốn trong hàm ggml_backend_tensor_get(). Bản phát hành cũng cung cấp các tệp thực thi biên dịch sẵn cho nhiều nền tảng, mặc dù hỗ trợ KleidiAI cho macOS Apple Silicon hiện đang bị vô hiệu hóa.

## KIẾN THỨC NỀN

llama.cpp là một thư viện mã nguồn mở được thiết kế để suy luận LLM hiệu quả, được xây dựng trên nền tảng thư viện tensor ggml. WebGPU là một tiêu chuẩn web và API hiện đại cho phép các ứng dụng web truy cập GPU của hệ thống để xử lý đồ họa và các tác vụ học máy hiệu năng cao. Việc căn chỉnh bộ nhớ chính xác, chẳng hạn như độ lệch phải là bội số của bốn, thường là yêu cầu bắt buộc đối với các API GPU để thực hiện truyền dữ liệu hiệu quả.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama.cpp#WebGPU#AI Inference#Open Source

$ subscribe --daily

Bản phát hành llama.cpp b10721 sửa lỗi sập nguồn trên WebGPU backend | Daily News