Bản phát hành b11489 của llama.cpp Tối ưu hóa Giải định lượng Q6_K cho Qualcomm Hexagon
Bản phát hành b11489 của llama.cpp mang đến tối ưu hóa hiệu năng cho quá trình giải định lượng (dequantization) trọng số mô hình Q6_K trên phần cứng Qualcomm Hexagon. Yêu cầu kéo này giúp tăng tốc xử lý trọng số bằng cách khai triển vòng lặp (loop unrolling) thêm 2 lần. Cải tiến này nâng cao hiệu năng suy luận mô hình ngôn ngữ lớn (LLM) cục bộ trên các thiết bị di động và thiết bị biên chip Snapdragon sử dụng Hexagon DSP hoặc NPU. Điều này giúp người dùng chạy các mô hình định lượng 6-bit có độ chính xác cao hơn một cách hiệu quả hơn trên phần cứng ARM. Tối ưu hóa này nhắm mục tiêu cụ thể vào các tiến trình giải định lượng trọng số Q6_K trên kiến trúc Qualcomm Hexagon (#30121). Các bản biên dịch sẵn đi kèm phát hành hỗ trợ nhiều hệ điều hành bao gồm Linux, Android, Windows, macOS và iOS.
## KIẾN THỨC NỀN
llama.cpp là một khung ứng dụng C/C++ mã nguồn mở được thiết kế để chạy các mô hình ngôn ngữ lớn (LLM) cục bộ trên phần cứng tiêu dùng với thiết lập tối thiểu và hiệu suất cao. Kỹ thuật định lượng mô hình giảm dung lượng bộ nhớ bằng cách chuyển đổi trọng số dấu phẩy động độ chính xác cao sang các định dạng số bit thấp hơn như Q6_K, yêu cầu giải định lượng trọng số trở lại trong quá trình suy luận. Qualcomm Hexagon là vi xử lý tín hiệu số (DSP) chuyên dụng tích hợp trong chip Snapdragon để tăng tốc các tác vụ AI và đa phương tiện trên thiết bị biên.