llama.cpp Phát Hành Bản b10743 Tối Ưu Hóa Metal Cho Apple M2 Pro
llama.cpp đã phát hành bản dựng b10743, mang đến các tinh chỉnh vector cho FlashAttention trên Apple Metal dành riêng cho chip Apple M2 Pro với các kiểu dữ liệu mới. Bản cập nhật này cũng làm mới các tệp thực thi biên dịch sẵn cho nhiều nền tảng bao gồm macOS, Linux, Windows và Android. Bản phát hành bảo trì định kỳ này mang lại những tối ưu hóa suy luận hữu ích cho người dùng chạy các mô hình ngôn ngữ lớn (LLM) cục bộ trên máy Mac chip Apple M2 Pro. Điều này thể hiện nỗ lực tinh chỉnh liên tục của dự án đối với các nhân tính toán tăng tốc phần cứng cho từng kiến trúc GPU cụ thể. Pull Request #28122 bổ sung các tham số tinh chỉnh vector cho FlashAttention và hỗ trợ kiểu dữ liệu mới cho GPU M2 Pro trong bộ tăng tốc Metal. Các tệp thực thi mới được đóng gói sẵn cho macOS (arm64, x64), Linux (CPU, Vulkan, ROCm, SYCL, OpenVINO), Windows (CUDA 12/13, Vulkan, ROCm) và Android.
## KIẾN THỨC NỀN
llama.cpp là một thư viện C/C++ mã nguồn mở phổ biến giúp chạy các mô hình ngôn ngữ lớn (LLM) cục bộ với hiệu năng cao trên thiết bị cá nhân. Trên các thiết bị macOS, thư viện này sử dụng ứng dụng đồ họa Metal của Apple để thực thi các phép toán mạng thần kinh trên GPU Apple Silicon. FlashAttention là một thuật toán được thiết kế nhằm đẩy nhanh cơ chế chú ý (attention) trong mô hình Transformer và giảm tiêu thụ bộ nhớ bằng cách tối ưu hóa việc đọc/ghi giữa bộ nhớ GPU và SRAM trên chip.