llama.cpp Phiên Bản b11345 Hỗ Trợ Lượng Hóa Q2_K và Q3_K Cho Qualcomm Hexagon DSP
Phiên bản b11345 của llama.cpp chính thức bổ sung hỗ trợ cho các kiểu lượng hóa Q2_K và Q3_K dành riêng cho backend Qualcomm Hexagon DSP. Yêu cầu kéo (#29717) này được đồng phát triển bởi kỹ sư Max Krasnyansky từ Qualcomm. Việc hỗ trợ lượng hóa bit thấp trên Qualcomm Hexagon DSP cho phép thiết bị di động và thiết bị biên dùng chip Snapdragon chạy các mô hình LLM với dung lượng bộ nhớ giảm đáng kể. Cải tiến này giúp nâng cao hiệu suất và tiết kiệm năng lượng cho các ứng dụng AI trực tiếp trên thiết bị. Bản cập nhật bao gồm các sửa lỗi mã nguồn backend để cấp phát bộ nhớ nhất quán cho `src1_row_size` trên kiến trúc Hexagon. Các bản binary đóng gói sẵn đã được phát hành cho nền tảng Snapdragon trên cả Linux arm64 và Android arm64.
## KIẾN THỨC NỀN
llama.cpp là một thư viện C/C++ mã nguồn mở giúp suy luận cục bộ các mô hình ngôn ngữ lớn với hiệu suất cao. Các phương pháp lượng hóa như Q2_K và Q3_K nén trọng số mô hình xuống dạng số nguyên 2-bit hoặc 3-bit để giảm tối đa dung lượng RAM tiêu thụ nhưng vẫn giữ được chất lượng mô hình ở mức chấp nhận được. Qualcomm Hexagon DSP là một bộ vi xử lý phụ chuyên dụng trong các vi mạch Snapdragon nhằm tăng tốc các tác vụ đa phương tiện và AI tiết kiệm điện năng.