llama.cpp Phát hành Bản b11486 Nâng cao Độ chính xác GELU trên Backend Qualcomm Hexagon
Phiên bản b11486 của llama.cpp vừa được phát hành, mang đến cập nhật (#30104) giúp cải thiện độ chính xác số học của hàm kích hoạt GELU khi chạy trên backend Qualcomm Hexagon. Cải tiến này được thực hiện với sự hỗ trợ từ OpenCode. Việc nâng cao độ chính xác toán học cho các hàm kích hoạt cốt lõi trên phần cứng chuyên dụng giúp tránh suy giảm chất lượng khi chạy LLM cục bộ trên các thiết bị di động và nhúng dùng Snapdragon. Khi AI trên thiết bị ngoại vi phát triển, việc duy trì tính toán chính xác trên các backend như Hexagon DSP là rất quan trọng đối với sự ổn định của mô hình. Bản phát hành cung cấp các tệp thực thi biên dịch sẵn cho nhiều môi trường, bao gồm bản dựng Linux arm64 và Android thiết kế riêng cho phần cứng Qualcomm Snapdragon hỗ trợ cả CPU, Adreno GPU và Hexagon NPU. Ngoài ra, tối ưu hóa KleidiAI vẫn bị tắt trong bản thực thi macOS Apple Silicon arm64.
## KIẾN THỨC NỀN
GELU (Gaussian Error Linear Unit) là hàm kích hoạt được áp dụng rộng rãi trong các mô hình ngôn ngữ dựa trên Transformer hiện đại để tạo tính phi tuyến. Qualcomm Hexagon là kiến trúc bộ xử lý tín hiệu số (DSP) và bộ xử lý thần kinh (NPU) tích hợp trên các chip Snapdragon nhằm tối ưu điện năng khi tính toán AI. llama.cpp là một thư viện suy luận mã nguồn mở phổ biến giúp chạy các mô hình ngôn ngữ lớn cục bộ trên nhiều kiến trúc phần cứng khác nhau.