llama.cpp b10729 Bổ Sung Tinh Chỉnh Vector Flash-Attention Cho Metal Trên Chip M1 Ultra
Dự án suy luận LLM mã nguồn mở llama.cpp đã phát hành phiên bản b10729, bổ sung các tinh chỉnh vector flash-attention (fa-vec) cho backend Metal được tối ưu riêng cho chip M1 Ultra của Apple. Cập nhật này giúp tối ưu hóa truy xuất bộ nhớ và tính toán cơ chế chú ý (attention) trên GPU của M1 Ultra. Tối ưu hóa này cải thiện hiệu năng suy luận mô hình ngôn ngữ lớn và hiệu quả sử dụng bộ nhớ cho người dùng chạy mô hình trên các thiết bị chạy chip M1 Ultra. Điều này thể hiện nỗ lực liên tục của dự án llama.cpp trong việc khai thác tối đa sức mạnh tính toán của phần cứng Apple Silicon. Pull request #28088 điều chỉnh mã nguồn của backend Metal để bổ sung các cấu hình tinh chỉnh vector phù hợp với kiến trúc của M1 Ultra. Cùng với sự thay đổi này, bản phát hành cũng cung cấp các tệp thực thi biên dịch sẵn cho nhiều hệ điều hành và backend tính toán khác nhau bao gồm CUDA 12/13, Vulkan, SYCL, ROCm 7.14 và OpenVINO.
## KIẾN THỨC NỀN
llama.cpp là một thư viện C/C++ phổ biến được thiết kế để chạy suy luận mô hình ngôn ngữ lớn (LLM) cục bộ hiệu quả trên nhiều nền tảng phần cứng. FlashAttention là một thuật toán quản lý bộ nhớ thông minh giúp tăng tốc đáng kể các lớp chú ý (attention) trong mô hình Transformer đồng thời giảm dung lượng bộ nhớ GPU cần thiết. Trên các thiết bị Apple, llama.cpp sử dụng API Metal để thực thi các tác vụ mạng nơ-ron trực tiếp trên GPU của Apple Silicon.