llama.cpp Phát Hành Bản Build b10990 Tối Ưu Hóa Sao Chép Bộ Nhớ Qua DMA
llama.cpp đã phát hành bản build b10990, bổ sung bản tối ưu hóa nhỏ (#28906) trong hex-cpy nhằm sử dụng Truy cập bộ nhớ trực tiếp (DMA) khi bộ đệm bộ nhớ nguồn và đích nằm liên tục. Việc chuyển giao các thao tác sao chép bộ nhớ sang DMA giúp giảm tải cho CPU trong quá trình di chuyển dữ liệu, nâng cao hiệu suất truyền dữ liệu tổng thể khi suy luận LLM. Bản vá tập trung cụ thể vào các vùng bộ nhớ liên tục trong quy trình hex-cpy. Bản phát hành cung cấp các tệp thực thi biên dịch sẵn cho macOS, Linux, Windows, iOS và Android trên các backend CPU, CUDA 12/13, Vulkan, ROCm và SYCL.
## KIẾN THỨC NỀN
llama.cpp là một thư viện mã nguồn mở hỗ trợ suy luận hiệu quả các Mô hình Ngôn ngữ Lớn (LLM) cục bộ trên nhiều kiến trúc phần cứng khác nhau. Truy cập bộ nhớ trực tiếp (DMA) là một tính năng trong kiến trúc máy tính cho phép các hệ thống phụ phần cứng đọc/ghi bộ nhớ hệ thống một cách độc lập mà không cần qua CPU.