~/LLAMA CPP/llama-cpp-release-b11540-adds-sycl-acceleration-for-mxfp4-moe-models

llama.cpp Phát Hành Bản b11540 Bổ Sung Tăng Tốc SYCL Cho Mô Hình MoE Dạng MXFP4

Phiên bản llama.cpp b11540 giới thiệu tính năng tăng tốc phần cứng cho các mô hình Mixture-of-Experts (MoE) dạng MXFP4 trên backend SYCL thông qua PR #29809. Cập nhật này cải thiện hiệu năng bằng cách áp dụng các kỹ thuật giải mã số học (arithmetic decoding) và sắp xếp lại trọng số (weight reordering). Cải tiến này cho phép suy luận nhanh hơn đối với các mô hình MoE 4-bit độ chính xác thấp trên phần cứng đa dạng được SYCL hỗ trợ, bao gồm cả GPU Intel. Khi các định dạng microscaling như MXFP4 trở thành tiêu chuẩn cho các mô hình AI lớn, các kernel xử lý tối ưu là yếu tố cốt lõi để đạt độ trễ thấp. Tối ưu hóa này tập trung đặc biệt vào các lớp MoE được lượng hóa MXFP4 trong luồng xử lý tính toán của SYCL. Các bản đóng gói sẵn (pre-built binaries) của b11540 hỗ trợ nhiều nền tảng từ macOS, Linux, Windows cho đến Android và Snapdragon.

## KIẾN THỨC NỀN

SYCL là chuẩn lập trình C++ đa nền tảng mở do Khronos Group quản lý, phục vụ tính toán song song trên nhiều loại GPU, CPU và bộ tăng tốc phần cứng khác nhau. MXFP4 (Microscaling FP4) là định dạng dữ liệu số thực dấu phẩy động 4-bit được thiết kế để giảm đáng kể băng thông bộ nhớ và dung lượng lưu trữ cho các mô hình ngôn ngữ lớn mà vẫn giữ được độ chính xác.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama-cpp#open-source-ai#hardware-acceleration#release-notes

$ subscribe --daily

llama.cpp Phát Hành Bản b11540 Bổ Sung Tăng Tốc SYCL Cho Mô Hình MoE Dạng MXFP4 | Daily News