~/LLAMA CPP/llama-cpp-b11490-adds-qualcomm-hexagon-buffer-optimizations-and-offloading-option

llama.cpp b11490 bổ sung tối ưu hóa bộ đệm và tùy chọn đẩy tải cho Qualcomm Hexagon

Phiên bản b11490 của llama.cpp giới thiệu hỗ trợ cấp phát nhiều bộ đệm (`alloc_buffer_n`) và tách tensor lớn cho backend Qualcomm Hexagon DSP. Bản phát hành này cũng bổ sung cờ `--no-embd-offload` mới và tăng dung lượng bộ đệm động mặc định lên 512MB để khắc phục suy giảm hiệu năng khi chạy các mô hình Mixture-of-Experts (MoE) lớn. Cập nhật này cải thiện hiệu năng và độ ổn định khi suy luận mô hình ngôn ngữ lớn trên các thiết bị di động và biên dùng chip Snapdragon tích hợp Hexagon NPU/DSP. Khi việc thực thi AI trực tiếp trên thiết bị ngày càng quan trọng, việc tối ưu hóa quản lý bộ đệm bộ nhớ giúp tránh tình trạng thắt cổ chai hiệu năng trong quá trình chạy các mô hình phức tạp. Tùy chọn cấu hình `GGML_HEXAGON_MBUF` đã được cập nhật để chấp nhận ba giá trị (`dyn`, `static`, `total`), cho phép kiểm soát tinh chỉnh tốt hơn đối với việc cấp phát bộ nhớ. Ngoài ra, tùy chọn dòng lệnh `--no-embd-offload` giúp đơn giản hóa các tập lệnh thực thi trên thiết bị Snapdragon khi không cần đẩy tải lớp embedding.

## KIẾN THỨC NỀN

llama.cpp là một thư viện C/C++ mã nguồn mở phổ biến được thiết kế để suy luận cục bộ hiệu quả các mô hình ngôn ngữ lớn trên nhiều backend phần cứng khác nhau. Qualcomm Hexagon DSP là các bộ xử lý phụ chuyên dụng được tích hợp trong các chip Snapdragon nhằm tăng tốc xử lý tín hiệu và các tác vụ AI trên thiết bị di động. Việc tối ưu hóa bộ đệm bộ nhớ trên các phần cứng nhúng này rất quan trọng vì băng thông bộ nhớ hạn chế có thể làm giảm đáng kể tốc độ suy luận.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama-cpp#llm-inference#open-source-ai#hardware-acceleration

$ subscribe --daily

llama.cpp b11490 bổ sung tối ưu hóa bộ đệm và tùy chọn đẩy tải cho Qualcomm Hexagon | Daily News