~/LLAMA CPP/llama-cpp-release-b10970-adds-fp32-accumulation-for-amd-cdna-gpus

llama.cpp phát hành b10970 cập nhật tích lũy FP32 cho GPU AMD CDNA

Phiên bản b10970 của llama.cpp cập nhật backend HIP để sử dụng các bộ tích lũy số thực dấu phẩy động 32-bit (FP32) trong các kernel fattn-mma trên phần cứng kiến trúc AMD CDNA. Cập nhật này cải thiện độ chính xác số học và tính ổn định khi tính toán cơ chế chú ý (attention) của mô hình ngôn ngữ lớn trên các GPU doanh nghiệp AMD Instinct. Điều này giúp ngăn ngừa hiện tượng mất độ chính xác hoặc tràn số khi suy luận mô hình lớn trên phần cứng máy chủ AMD. Thay đổi này tập trung cụ thể vào việc thực thi lệnh MFMA (Matrix Fused-Multiply Add) trong cài đặt fattn-mma cho kiến trúc CDNA (#28576). Bản phát hành bao gồm các tệp thực thi biên dịch sẵn cho nhiều nền tảng như Linux CUDA, ROCm, Vulkan và SYCL.

## KIẾN THỨC NỀN

Kiến trúc CDNA của AMD được thiết kế dành riêng cho các tác vụ máy tính doanh nghiệp và trí tuệ nhân tạo, vận hành dòng GPU AMD Instinct. Trong llama.cpp, backend HIP khai thác các Matrix Core của AMD thông qua các lệnh phần cứng MFMA chuyên dụng để tăng tốc các phép nhân ma trận thiết yếu cho quá trình suy luận mô hình Transformer.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama-cpp#AMD HIP#LLM Infrastructure#Open Source AI

$ subscribe --daily

llama.cpp phát hành b10970 cập nhật tích lũy FP32 cho GPU AMD CDNA | Daily News