llama.cpp Phát Hành Bản b11500 Sửa Lỗi Căn Chỉnh Bộ Nhớ Trong Phép Toán Fused Bias-Add
Khung suy luận LLM mã nguồn mở llama.cpp đã phát hành phiên bản b11500, sửa lỗi xử lý căn chỉnh bộ nhớ trong các hàm nhân ma trận Hexagon. Bản vá đảm bảo hệ thống không tự động giả định việc đọc/ghi bộ nhớ đã được căn chỉnh khi gộp phép cộng bias vào phép nhân ma trận. Bản sửa lỗi này giúp ngăn ngừa nguy cơ lỗi bộ nhớ hoặc treo ứng dụng trên các phần cứng hỗ trợ tăng tốc Hexagon DSP/NPU, chẳng hạn như chip Qualcomm Snapdragon. Điều này duy trì tính ổn định khi chạy các tác vụ suy luận AI cục bộ tối ưu hóa bằng gộp kernel trên thiết bị di động và thiết bị biên. Bản cập nhật tập trung vào hàm `hex-mmadd` (pull request #30133) bằng cách bỏ yêu cầu căn chỉnh bộ nhớ bắt buộc khi thực hiện các phép toán gộp bias-add. Các tệp thực thi đóng gói sẵn cho bản phát hành tự động này đã được cập nhật trên các nền tảng hỗ trợ bao gồm macOS, Linux, Windows, Android và môi trường Snapdragon.
## KIẾN THỨC NỀN
llama.cpp là một thư viện phổ biến được thiết kế để chạy các mô hình ngôn ngữ lớn trên phần cứng cục bộ thuộc nhiều nền tảng tính toán khác nhau, bao gồm NPU Qualcomm Hexagon. Kỹ thuật gộp phép toán (fused operations) kết hợp nhiều bước như nhân ma trận và cộng bias thành một bước thực thi duy nhất nhằm giảm chi phí truy xuất bộ nhớ. Tuy nhiên, một số lệnh phần cứng yêu cầu xử lý cẩn thận các địa chỉ bộ nhớ nếu dữ liệu chưa được căn chỉnh theo ranh giới byte quy định.