~/LLAMA CPP/llama-cpp-b11168-enhances-qualcomm-hexagon-dynamic-quantization-backend

llama.cpp b11168 Cải Thiện Backend Định Lượng Động Cho Qualcomm Hexagon

Phiên bản b11168 của llama.cpp mang đến các cải tiến cho bộ định lượng động (dynamic quantizer) trên phần cứng Qualcomm Hexagon, bao gồm sửa lỗi độ chính xác cho phép nhân ma trận Q8_0 (`MUL_MAT`). Phiên bản này cũng chuyển toàn bộ các đường dẫn định lượng động sang sử dụng Truy cập Bộ nhớ Trực tiếp (DMA) và khắc phục lỗi tràn thanh ghi. Những tối ưu hóa này nâng cao độ chính xác và hiệu suất suy luận khi chạy các mô hình ngôn ngữ lớn (LLM) trên các thiết bị biên trang bị chip Qualcomm Snapdragon. Việc tận dụng DMA trên các luồng định lượng động giúp giảm tải cho CPU và cải thiện tốc độ truyền dữ liệu trong quá trình thực thi mô hình. Các cập nhật kỹ thuật bao gồm định tuyến toàn bộ dữ liệu kích hoạt qua DMA, loại bỏ tác vụ cũ `run_quant_task`, tái cấu trúc các thao tác nhân ma trận (`matmul-ops`), và dọn dẹp các phép ép kiểu `dma_addr_t` trong cơ sở mã của Hexagon Tensor Processor (HTP).

## KIẾN THỨC NỀN

llama.cpp là một khung ứng dụng nguồn mở bằng C/C++ phổ biến được thiết kế để suy luận LLM hiệu năng cao trên nhiều kiến trúc phần cứng khác nhau. Qualcomm Hexagon là bộ xử lý tín hiệu số (DSP) chuyên dụng được tích hợp trong các chip Snapdragon, giúp tối ưu hóa việc thực thi các tác vụ AI và phép toán ma trận hiệu quả trên thiết bị di động và thiết bị biên.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama-cpp#quantization#qualcomm-hexagon#ai-infrastructure#open-source

$ subscribe --daily

llama.cpp b11168 Cải Thiện Backend Định Lượng Động Cho Qualcomm Hexagon | Daily News