llama.cpp Phát Hành Bản b10989 Hỗ Trợ HIP AllReduce Cho GPU AMD ROCm
Trình suy luận LLM mã nguồn mở llama.cpp đã phát hành phiên bản b10989, bổ sung khả năng hỗ trợ HIP AllReduce cho GPU AMD ROCm. Bản phát hành này cũng đi kèm các tệp thực thi đóng gói sẵn (pre-built binaries) được cập nhật trên các nền tảng Linux, Windows, macOS và Android. Việc kích hoạt AllReduce trên HIP giúp cải thiện hiệu suất truyền thông và khả năng vận hành đa GPU trên phần cứng đồ họa AMD chạy nền tảng ROCm. Điều này nâng cao khả năng mở rộng khi suy luận LLM mã nguồn mở trên phần cứng GPU ngoài NVIDIA. Bản cập nhật kích hoạt lại giải pháp AllReduce đa GPU nội bộ của llama.cpp trên HIP bằng cách tận dụng các hàm bộ nhớ host khả thi như `cudaHostAllocPortable` và `cudaHostAllocMapped`. Các tệp thực thi trong bản phát hành này bao gồm hỗ trợ cho CUDA 12/13, ROCm, Vulkan, SYCL, OpenVINO và CPU trên cả kiến trúc x86 lẫn ARM.
## KIẾN THỨC NỀN
llama.cpp là thư viện C/C++ mã nguồn mở hiệu năng cao được thiết kế để chạy suy luận Mô hình Ngôn ngữ Lớn (LLM) cục bộ trên nhiều phần cứng khác nhau. Hệ sinh thái ROCm của AMD dựa vào HIP (Heterogeneous-computing Interface for Portability), một API C++ giúp viết mã nguồn có tính di động giữa GPU AMD và NVIDIA. AllReduce là một thao tác truyền thông tập thể trong tính toán phân tán, có nhiệm vụ tổng hợp dữ liệu từ tất cả các GPU tham gia và phân phối lại kết quả cho từng GPU.