llama.cpp b11055 Bổ Sung Hỗ Trợ Hàm Kích Hoạt GEGLU_QUICK Cho Backend Qualcomm Hexagon
Công cụ suy luận LLM nguồn mở llama.cpp đã phát hành phiên bản b11055 với yêu cầu kéo (pull request) #29114. Bản cập nhật này bổ sung hỗ trợ cho hàm kích hoạt GEGLU_QUICK trên backend Qualcomm Hexagon. Việc mở rộng hỗ trợ hàm kích hoạt trên phần cứng Qualcomm Hexagon cho phép các mô hình sử dụng biến thể kiến trúc GEGLU chạy hiệu quả trên các thiết bị di động và edge dùng chip Snapdragon. Điều này giúp nâng cao khả năng suy luận LLM trực tiếp trên thiết bị (on-device) cho nhiều kiến trúc mạng thần kinh hơn. Bản phát hành này tích hợp cụ thể biến thể `GEGLU_QUICK`, một bản xấp xỉ tối ưu của hàm kích hoạt Gaussian Error Gated Linear Unit, vào backend tăng tốc phần cứng Hexagon. Các tập tin thực thi (binary) cho bản dựng b11055 đã được cung cấp trên nhiều hệ điều hành và nền tảng bao gồm Android, Linux, macOS và Windows.
## KIẾN THỨC NỀN
Qualcomm Hexagon là kiến trúc bộ xử lý tín hiệu số (DSP) chuyên dụng tích hợp trong vi xử lý Snapdragon, được tối ưu hóa cho các tác vụ AI và đa phương tiện tiết kiệm điện năng trên thiết bị di động. GEGLU (Gaussian Error Gated Linear Unit) là một biến thể của hàm kích hoạt Gated Linear Unit kết hợp với GELU, được ứng dụng rộng rãi trong các kiến trúc Transformer hiện đại để cải thiện dung lượng và hiệu quả huấn luyện mô hình.