~/LLAMA CPP/llama-cpp-b11316-released-with-metal-backend-optimizations-for-mxfp4

llama.cpp Phát Hành Bản b11316 Tối Ưu Hóa Metal Backend Cho MXFP4

Bản phát hành llama.cpp b11316 cập nhật Metal backend trên thiết bị Apple để sử dụng tính toán bfloat16 (bf16) khi thực hiện phép nhân ma trận MXFP4. Thay đổi này giúp tối ưu hóa hiệu năng và độ chính xác khi suy luận các mô hình lượng hóa bit thấp trên phần cứng Apple. Khi các định dạng lượng hóa vi tỷ lệ 4-bit như MXFP4 ngày càng phổ biến trên các mô hình ngôn ngữ lớn, việc tối ưu hóa nhân nhân ma trận cho Apple Silicon là chìa khóa cho suy luận cục bộ tốc độ cao. Chuyển sang tính toán bfloat16 giúp duy trì dải động số học trong khi vẫn đảm bảo hiệu suất tính toán trên GPU Apple. Bản cập nhật tích hợp pull request #29770, điều chỉnh các compute shader của Metal dành riêng cho quy trình nhân ma trận MXFP4 (`mul-mat`). Các bản dựng sẵn đã được cung cấp cho Linux, Windows, macOS, Android và Snapdragon, dù bản dựng macOS arm64 kích hoạt KleidiAI vẫn tiếp tục bị vô hiệu hóa.

## KIẾN THỨC NỀN

llama.cpp là một khung ứng dụng C/C++ mã nguồn mở phổ biến giúp suy luận mô hình ngôn ngữ lớn (LLM) hiệu năng cao trên máy tính cá nhân và thiết bị ngoại biên. MXFP4 (Microscaling 4-bit Floating Point) là định dạng lượng hóa 4-bit giúp nén trọng số mạng nơ-ron nhưng vẫn giữ được độ chính xác nhờ hệ số tỷ lệ theo khối nhỏ. Metal là API tính toán cấp thấp của Apple được llama.cpp dùng để tăng tốc phần cứng trên các dòng chip Apple Silicon.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama-cpp#ai-infrastructure#apple-metal#open-source

$ subscribe --daily

llama.cpp Phát Hành Bản b11316 Tối Ưu Hóa Metal Backend Cho MXFP4 | Daily News