~/LLAMA CPP/llama-cpp-b11178-improves-support-and-performance-for-moore-threads-musa-gpus

llama.cpp b11178 Cải thiện Hiệu năng và Hỗ trợ cho GPU Moore Threads MUSA

Bản phát hành llama.cpp b11178 mang đến các bản sửa lỗi dành riêng cho GPU Moore Threads MUSA, bao gồm việc bật sao chép bộ nhớ 16-byte cho kernel FlashAttention và kích hoạt các thuật toán từ thư viện CUB. Những cập nhật này sửa các lỗi toán tử và tăng tốc độ xử lý prefill trên các thiết bị như MTT S5000. Bản cập nhật này mở rộng tính đa dạng phần cứng cho việc suy luận LLM mã nguồn mở bằng cách đảm bảo các GPU không phải của NVIDIA từ Moore Threads hoạt động hiệu quả. Nó giúp tăng tốc độ prefill của FlashAttention (lên đến ~795 token/giây trên MTT S5000) và đạt khả năng tương thích toán tử tương đương CUDA cho các thao tác như ARGSORT và TOP_K. Trình biên dịch MUSA (`mcc`) trước đây không định nghĩa `__CUDA_ARCH__`, khiến kích thước sao chép bộ nhớ bị hạ xuống 8 bytes thay vì 16 bytes trong FlashAttention. Thêm vào đó, việc kích hoạt trực tiếp các đường dẫn CUB cho MUSA đã gỡ bỏ giới hạn 1024 phần tử đối với các toán tử ARGSORT và TOP_K.

## KIẾN THỨC NỀN

llama.cpp là một công cụ suy luận C/C++ mã nguồn mở phổ biến được thiết kế để chạy các Mô hình Ngôn ngữ Lớn hiệu quả trên nhiều loại phần cứng. MUSA (Moore Threads Unified System Architecture) là nền tảng GPU do công ty Moore Threads của Trung Quốc phát triển, trong khi CUB là thư viện CUDA cung cấp các thuật toán xử lý song song hiệu năng cao cho GPU.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama-cpp#LLM#MUSA#GPU#Open-Source-AI

$ subscribe --daily

llama.cpp b11178 Cải thiện Hiệu năng và Hỗ trợ cho GPU Moore Threads MUSA | Daily News