~/LLAMA CPP/llama-cpp-release-b10795-adds-sycl-kernel-fusion-optimizations

llama.cpp Phát Hành Bản Release b10795 Bổ Sung Tối Ưu Hóa Gộp Kernel Cho SYCL

Bản phát hành b10795 của llama.cpp giới thiệu các tối ưu hóa cho backend SYCL giúp gộp các chuỗi thao tác RMS_NORM+MUL+ADD và ADD+ADD. Cập nhật này cho phép nhiều phép toán tensor liên tiếp được thực thi trong một lệnh gọi kernel GPU duy nhất thông qua cờ GGML_SYCL_ENABLE_FUSION. Kỹ thuật gộp kernel (kernel fusion) giúp giảm đáng kể chi phí băng thông bộ nhớ và độ trễ khởi chạy kernel trên GPU, từ đó tăng tốc suy luận LLM trên phần cứng hỗ trợ SYCL như GPU Intel. Nó nâng cao hiệu suất thực thi cho các kết nối tàn dư và lớp chuẩn hóa vốn được sử dụng rất nhiều trong các mô hình Transformer. Thao tác gộp ADD+ADD hỗ trợ nhiều kiểu dữ liệu bao gồm f32, f16, bf16, i32 và i16, cùng với các tensor phát quảng bá (broadcast) và không liền kề. Nếu gặp sự kết hợp ma trận hoặc độ chính xác không được hỗ trợ, hệ thống sẽ tự động chuyển về phương án gọi hai kernel add() riêng biệt.

## KIẾN THỨC NỀN

SYCL là một tiêu chuẩn lập trình C++ mở, đa nền tảng cho phép thực thi mã nguồn trên các phần cứng hỗn hợp như GPU và bộ tăng tốc. Gộp kernel (kernel fusion) là kỹ thuật tối ưu hóa kết hợp các phép toán nối tiếp thành một bước thực thi duy nhất trên GPU nhằm giảm thiểu lượt truy xuất VRAM. RMSNorm và phép cộng tàn dư là các thành phần tính toán cốt lõi được thực hiện thường xuyên qua từng lớp Transformer trong các mô hình ngôn ngữ lớn hiện đại.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama.cpp#AI/ML#GPU Acceleration#Open-Source AI

$ subscribe --daily

llama.cpp Phát Hành Bản Release b10795 Bổ Sung Tối Ưu Hóa Gộp Kernel Cho SYCL | Daily News