llama.cpp Phát Hành Bản b11170 Sửa Lỗi Cho Backend Qualcomm Hexagon
Công cụ suy luận mô hình ngôn ngữ lớn nguồn mở llama.cpp đã phát hành phiên bản b11170, mang tới bản sửa lỗi xử lý dữ liệu đa chuỗi (multi-sequence) trong phép toán `concat_2d` cho backend Qualcomm Hexagon. Bản sửa lỗi này nâng cao độ ổn định khi tăng tốc phần cứng trên các nền tảng Qualcomm Snapdragon được trang bị Hexagon DSP và NPU. Điều này đóng góp vào xu hướng chạy các mô hình AI phức tạp trực tiếp trên thiết bị biên như máy tính xách tay ARM và điện thoại thông minh. Bản vá giải quyết pull request #29344 nhằm sửa lại hành vi nối chuỗi trong các phép toán tensor trên Hexagon. Các bản biên dịch sẵn cho Linux, Android, Windows ARM64 Snapdragon, macOS và iOS cũng đã được phát hành trong chu kỳ đóng gói tự động này.
## KIẾN THỨC NỀN
llama.cpp là một framework C/C++ phổ biến được thiết kế để suy luận cục bộ độ trễ thấp các mô hình ngôn ngữ lớn trên CPU, GPU và các bộ tăng tốc phần cứng chuyên dụng. Qualcomm Hexagon là kiến trúc Bộ xử lý tín hiệu số (DSP) và Bộ xử lý thần kinh (NPU) tích hợp trong vi xử lý Snapdragon nhằm tính toán hiệu quả các tác vụ máy học.