Phiên bản llama.cpp b11045 bổ sung hỗ trợ phép toán ROLL cho Qualcomm Hexagon DSP
Công cụ chạy mô hình ngôn ngữ lớn nguồn mở llama.cpp đã phát hành bản dựng b11045, bổ sung hỗ trợ cho phép toán tensor ROLL trên bộ xử lý tín hiệu số (DSP) Qualcomm Hexagon (PR #29105). Việc mở rộng hỗ trợ phép toán tensor cho Qualcomm Hexagon giúp cải thiện hiệu suất tăng tốc suy luận LLM bằng phần cứng trên các nền tảng di động và thiết bị biên dùng vi xử lý Snapdragon. Điều này cho phép thực thi hiệu quả hơn các kiến trúc mạng thần kinh trực tiếp trên phần phần cứng DSP di động. Bản phát hành tập trung vào PR #29105, nhằm triển khai toán tử thao tác tensor ROLL cho backend xử lý Hexagon. Các bản biên dịch sẵn (binary) được phát hành trên nhiều nền tảng bao gồm Android arm64, Linux, Windows, macOS, CUDA 12/13, Vulkan và SYCL.
## KIẾN THỨC NỀN
llama.cpp là một thư viện C/C++ hiệu năng cao được thiết kế để chạy các mô hình ngôn ngữ lớn cục bộ trên nhiều kiến trúc phần cứng khác nhau. Qualcomm Hexagon là bộ xử lý tín hiệu số (DSP) chuyên dụng được tích hợp trong các SoC Snapdragon, giúp tăng tốc phần cứng cho các phép toán vector và tác vụ học máy trên thiết bị di động.