llama.cpp b10643 Ra Mắt Hỗ Trợ Đa NPU Hexagon
Bản phát hành llama.cpp b10643 giới thiệu khả năng hỗ trợ các thiết bị Qualcomm Hexagon đa NPU và triển khai một backend hoàn toàn bất đồng bộ. Phiên bản này cũng bổ sung các tối ưu hóa như đường ống DMA, điều chỉnh bố cục VTCM và các thao tác ALLREDUCE kết hợp. Bản cập nhật này cải thiện đáng kể hiệu suất và hiệu quả suy luận LLM trên các thiết bị biên chạy chip Snapdragon. Bằng cách cho phép tận dụng đa NPU và xử lý bất đồng bộ, nó giúp thực thi AI cục bộ nhanh hơn và tiết kiệm điện năng hơn trên phần cứng di động và thiết bị biên. Bản phát hành này có backend hoàn toàn bất đồng bộ sử dụng bộ đệm không thuộc máy chủ (non-host buffers) theo mặc định, cùng với việc hỗ trợ lượng tử hóa Q8_0 với bộ giải lượng tử hóa tại chỗ (in-place dequantizers). Nó cũng giới thiệu các token đồng bộ để điều phối nhiều thiết bị NPU trong quá trình phân tách tensor bất đồng bộ.
## KIẾN THỨC NỀN
Qualcomm Hexagon là một dòng bộ xử lý tín hiệu số (DSP) và bộ xử lý thần kinh (NPU) được thiết kế để tăng tốc AI hiệu năng cao, tiết kiệm điện năng trên chip Snapdragon. Vector Tightly Coupled Memory (VTCM) là kiến trúc bộ nhớ trên chip tốc độ cao được sử dụng trong bộ xử lý Hexagon để tăng tốc các phép toán vector. llama.cpp là một dự án mã nguồn mở phổ biến cho phép suy luận LLM hiệu quả trên nhiều backend phần cứng khác nhau.