~/LLAMA CPP/llama-cpp-release-b11126-adds-vulkan-iq4-xs-quantization-kernels

llama.cpp Phát Hành Bản b11126 Bổ Sung Kernel Lượng Hóa Vulkan IQ4_XS

Bản phát hành b11126 của llama.cpp bổ sung các kernel nhân ma trận MMQ và MMV được tối ưu hóa cho định dạng lượng hóa IQ4_XS trên backend Vulkan. Ngoài ra, phiên bản này xử lý sự cố sụt giảm 27,3% hiệu năng sinh văn bản trên GPU Intel bằng cách tắt MMVQ đối với IQ4_XS trên phần cứng Intel. Cập nhật này tăng tốc độ suy luận GPU đa nền tảng cho người dùng chạy các mô hình lượng hóa bit thấp thông qua Vulkan. Bản cập nhật cũng duy trì sự ổn định hiệu năng trên các GPU không phải Nvidia, đặc biệt là dòng card đồ họa Intel Arc. Bản phát hành loại bỏ nhánh logic bộ nhớ chia sẻ thừa cho IQ4_XS trong các GLSL shader của Vulkan và tinh chỉnh việc xử lý vectơ bộ nhớ. Các tối ưu hóa này được thực hiện với sự hỗ trợ từ các công cụ AI như OpenAI Codex và Claude Opus 5.

## KIẾN THỨC NỀN

llama.cpp là thư viện mã nguồn mở phổ biến cho phép suy luận cục bộ các Mô hình Ngôn ngữ Lớn (LLM) một cách hiệu quả trên nhiều kiến trúc CPU và GPU. IQ4_XS là định dạng lượng hóa phi tuyến 4-bit giúp nén trọng số LLM xuống còn khoảng 4,25 bit cho mỗi trọng số nhằm tiết kiệm dung lượng bộ nhớ. Vulkan cung cấp API tính toán GPU đa nền tảng, cho phép tăng tốc phần cứng trên các GPU từ AMD, Intel và các thiết bị di động.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama-cpp#vulkan#quantization#llm-inference#open-source-ai

$ subscribe --daily

llama.cpp Phát Hành Bản b11126 Bổ Sung Kernel Lượng Hóa Vulkan IQ4_XS | Daily News