~/LLAMA CPP/llama-cpp-release-b10790-tunes-cuda-kernel-crossover-for-nvidia-orin-sm87

Phiên bản llama.cpp b10790 tinh chỉnh chuyển đổi kernel CUDA cho NVIDIA Orin (SM87)

Dự án llama.cpp đã phát hành phiên bản b10790, tích hợp PR #28285 giúp tinh chỉnh ngưỡng chuyển đổi giữa các kernel CUDA MMVQ và MMQ trên phần cứng SM87. Bản phát hành tự động này cũng cập nhật các tệp thực thi đóng gói sẵn cho các nền tảng Linux, Windows, macOS, Android và iOS. Cải tiến này nâng cao hiệu suất suy luận CUDA cho người dùng chạy các mô hình ngôn ngữ lớn đã định lượng trên thiết bị AI biên NVIDIA Jetson Orin. Việc tinh chỉnh điểm chuyển đổi giữa kernel vectơ và kernel ma trận giúp thời gian thực thi duy trì băng thông cao hơn khi xử lý prompt và tạo token. Sự thay đổi này nhắm cụ thể vào kiến trúc NVIDIA SM87 (Compute Capability 8.7) bằng cách tối ưu hóa thời điểm ggml-cuda chuyển từ luồng thực thi MMVQ (Matrix-Matrix-Vector Quantized) sang MMQ (Matrix-Matrix Quantized). Các bản đóng gói sẵn hỗ trợ nhiều backend tính toán như CUDA 12/13, Vulkan, ROCm, OpenVINO và SYCL.

## KIẾN THỨC NỀN

llama.cpp là một khung suy luận C/C++ phổ biến được thiết kế để chạy các mô hình ngôn ngữ lớn hiệu quả trên nhiều loại phần cứng. Trong backend CUDA của nó, MMVQ xử lý các phép tính ma trận - vectơ khi sinh token đơn lẻ, trong khi MMQ xử lý các phép tính ma trận - ma trận cho kích thước lô lớn hơn và xử lý prompt. NVIDIA SM87 đại diện cho cấp độ tính toán GPU của các dòng vi xử lý Jetson AGX Orin và Orin Nano.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama.cpp#LLM#AI Infrastructure#Release Notes

$ subscribe --daily

Phiên bản llama.cpp b10790 tinh chỉnh chuyển đổi kernel CUDA cho NVIDIA Orin (SM87) | Daily News