llama.cpp Phát Hành Bản Dựng b10639 Sửa Lỗi Kích Thước Warp Trên Vulkan
llama.cpp đã phát hành bản dựng b10639, giới hạn kích thước warp của Vulkan để khắc phục sự cố trên các phần cứng có kích thước warp lớn hơn 64. Bản phát hành này đảm bảo khả năng tương thích tốt hơn và ngăn ngừa lỗi hoặc hành vi không mong muốn khi chạy llama.cpp qua backend Vulkan trên các GPU có kích thước warp lớn. Điều này duy trì tính ổn định của việc suy luận AI cục bộ nguồn mở trên nhiều cấu hình phần cứng khác nhau. Bản sửa lỗi giải quyết giới hạn trong các warptile của Vulkan, vốn trước đây giả định kích thước warp luôn nhỏ hơn hoặc bằng 64. Bản dựng này cũng cung cấp các tệp thực thi cập nhật cho nhiều nền tảng bao gồm Windows, Linux, macOS và Android.
## KIẾN THỨC NỀN
llama.cpp là một dự án nguồn mở phổ biến cho phép suy luận mô hình ngôn ngữ lớn (LLM) hiệu quả trên phần cứng tiêu dùng. Vulkan là một API đồ họa và tính toán đa nền tảng được sử dụng để tăng tốc tính toán trên nhiều loại GPU khác nhau. Trong tính toán GPU, một "warp" (hoặc wave) là một nhóm các luồng được thực thi song song, và việc xử lý các kích thước warp khác nhau là rất quan trọng đối với hiệu suất và độ ổn định trên các phần cứng khác nhau.