llama.cpp Phát Hành Bản Dựng b10201 Tối Ưu Hóa Flash Attention Cho WebGPU
llama.cpp đã phát hành bản dựng b10201, mang lại những cải tiến hiệu năng cho tính năng flash attention trên WebGPU (flash_attn_vec) khi sử dụng bộ nhớ đệm Key-Value (KV cache) đã được lượng tử hóa. Bản cập nhật này đặc biệt tối ưu hóa quá trình xử lý trong các kịch bản ngữ cảnh dài. Việc chạy các mô hình ngôn ngữ lớn trực tiếp trên trình duyệt web thông qua WebGPU thường gặp phải các nút thắt cổ chai về bộ nhớ và hiệu năng. Bằng cách tối ưu hóa KV cache lượng tử hóa cho các ngữ cảnh dài, bản phát hành này cho phép suy luận LLM cục bộ hiệu quả và dễ mở rộng hơn trên các nền tảng web. Bản phát hành tích hợp pull request #25956, giúp cải tiến triển khai flash_attn_vec cho KV cache lượng tử hóa và sửa một số lỗi liên quan. Ngoài ra, hỗ trợ KleidiAI cho macOS Apple Silicon (arm64) vẫn bị vô hiệu hóa trong bản dựng này.
## KIẾN THỨC NỀN
WebGPU là một API web hiện đại cho phép trình duyệt truy cập vào khả năng tăng tốc phần cứng của GPU để tính toán. Trong suy luận LLM, bộ nhớ đệm Key-Value (KV cache) lưu trữ các biểu diễn token trước đó để tránh tính toán lặp lại, nhưng nó sẽ phình to theo chiều dài ngữ cảnh. Lượng tử hóa (quantization) giúp giảm dung lượng bộ nhớ của bộ đệm này, trong khi Flash Attention tối ưu hóa các mẫu truy cập bộ nhớ để tăng tốc độ tính toán cơ chế chú ý (attention).