Phiên bản llama.cpp b11093 sửa lỗi giới hạn mặt nạ trong Metal Flash Attention
Dự án engine suy luận LLM mã nguồn mở llama.cpp đã phát hành bản dựng b11093, khắc phục lỗi giới hạn mặt nạ (mask bounds) trong bước xử lý trước (pre-pass) của tính năng Metal Flash Attention. Bản cập nhật định kỳ này giúp cải thiện độ chính xác tính toán và tính ổn định khi chạy các mô hình transformer trên thiết bị Apple Silicon sử dụng tăng tốc Metal. Bản phát hành đi kèm với các tệp thực thi biên dịch sẵn cho nhiều nền tảng như macOS, Linux, Windows và Android, hỗ trợ các backend bao gồm CUDA, Vulkan, ROCm và SYCL.
## KIẾN THỨC NỀN
llama.cpp là một khung ứng dụng C/C++ được sử dụng rộng rãi để chạy các mô hình ngôn ngữ lớn (LLM) một cách hiệu quả trên phần cứng thương mại. Flash Attention là thuật toán tối ưu hóa cơ chế chú ý giúp giảm mức tiêu thụ bộ nhớ và tăng tốc suy luận bằng cách chia nhỏ ma trận điểm số để xử lý. Metal là API đồ họa và tính toán GPU của Apple, được thiết kế để đạt hiệu năng cao trên phần cứng của Apple.