llama.cpp Phát Hành Bản b10758 Bổ Sung Tối Ưu Hóa Hexagon DSP và Ma Trận
Bản phát hành llama.cpp b10758 giới thiệu các cập nhật hiệu năng quan trọng cho Hexagon DSP, bao gồm việc hợp nhất phép nhân ma trận QKV và FFN cho phần cứng HMX của Qualcomm. Phiên bản này cũng bổ sung tính năng chống phân mảnh địa chỉ ảo và sắp xếp bộ đệm nhằm ngăn lỗi cấp phát bộ nhớ trong quá trình suy luận. Các tối ưu hóa này nâng cao đáng kể hiệu suất và độ ổn định khi chạy LLM cục bộ trên các thiết bị Qualcomm Snapdragon sử dụng Hexagon DSP. Bằng cách giảm chi phí bộ nhớ và bớt các lệnh phần cứng, các ứng dụng AI trên thiết bị di động có thể đạt tốc độ suy luận cao hơn với mức tiêu thụ điện năng thấp hơn. Bản cập nhật loại bỏ giới hạn kích thước 32K cứng, thay thế các phép chia vô hướng bằng fastdiv, và thắt chặt tính toán chi phí để đảm bảo kích thước lớn không vượt quá ngân sách Bộ nhớ Kết nối Chặt chẽ Vector (VTCM). Ngoài ra, các thao tác MUL_MAT_ID được hợp nhất thành MUL_MAT_ID_NX để tối ưu hóa hàng đợi vận hành trên HMX.
## KIẾN THỨC NỀN
Qualcomm Hexagon là dòng bộ xử lý tín hiệu kỹ thuật số (DSP) và NPU trên các chip Snapdragon di động, sở hữu các phần mở rộng ma trận Hexagon (HMX) được thiết kế riêng để tăng tốc phần cứng cho các phép tính tensor. Việc suy luận LLM hiệu quả trên phần cứng thiết bị di động đòi hỏi phải khai thác Bộ nhớ Kết nối Chặt chẽ Vector (VTCM), một vùng bộ nhớ cực nhanh trên chip, yêu cầu quản lý dung lượng nghiêm ngặt để tránh lỗi chương trình.