llama.cpp Phát Hành Bản b11518 Bổ Sung Kernel Flash Attention 128/96 Cho Metal
llama.cpp đã phát hành phiên bản b11518, bổ sung các kernel Flash Attention 128/96 cho backend Metal trên các thiết bị Apple. Bản cập nhật này cũng giúp framework chấp nhận mọi cặp kernel đã được biên dịch nhằm nâng cao tính linh hoạt khi thực thi. Bản cập nhật này giúp tối ưu hóa bộ nhớ và tăng tốc quá trình suy luận LLM trên các thiết bị Apple Silicon nhờ mở rộng khả năng hỗ trợ kernel Flash Attention. Điều này cho phép các mô hình sử dụng kích thước head dimension 128 hoặc 96 chạy hiệu quả hơn trên thiết bị macOS và iOS. Bản cập nhật được thực hiện thông qua pull request #30209 và nhắm mục tiêu cụ thể vào các kernel tính toán Metal cho kích thước head dimension 128 và 96. Cùng với bản phát hành, các bản đóng gói sẵn đã được cung cấp cho macOS, iOS, Linux, Android và Windows trên các backend CPU, CUDA, Vulkan và Snapdragon.
## KIẾN THỨC NỀN
llama.cpp là một framework mã nguồn mở được thiết kế để suy luận LLM cục bộ với hiệu năng cao trên nhiều kiến trúc phần cứng khác nhau. Metal là framework tính toán của Apple giúp tăng tốc đồ họa và các tác vụ GPU chung trên phần cứng Apple Silicon. Flash Attention là một thuật toán tối ưu bộ nhớ sử dụng kỹ thuật phân mảnh (tiling) để giảm thiểu thao tác I/O trên bộ nhớ, giúp các mô hình Transformer tính toán nhanh hơn.