llama.cpp Bản Phát Hành b10867 Tắt Chế Độ Tải Tensor Lười Trên iGPU
llama.cpp phiên bản b10867 cập nhật hành vi tải tensor mặc định nhằm tắt chế độ tải lười (lazy loading) trên các card đồ họa tích hợp (iGPU) ở chế độ tự động. Bản phát hành này bao gồm pull request #28326 giúp khắc phục sự cố sụt giảm hiệu năng trên phần cứng iGPU. Card đồ họa tích hợp chia sẻ bộ nhớ hệ thống với CPU, nơi chế độ tải tensor lười có thể gây ra lỗi trang (page faults) hoặc tăng độ trễ truy xuất bộ nhớ. Việc tắt chế độ này theo mặc định trên iGPU giúp đảm bảo hiệu năng ổn định và tốc độ xử lý tốt hơn cho người dùng chạy các mô hình ngôn ngữ lớn (LLM) cục bộ. Bản cập nhật tinh chỉnh thiết lập tải tensor lười tự động (`LLAMA_LAZY_MODE_AUTO`) để tắt tính năng này trên iGPU nhưng vẫn giữ nguyên các khả năng ánh xạ bộ nhớ khác. Các bản thực thi cập nhật đã được phát hành cho macOS, Windows, Linux, Android và các backend bao gồm CUDA 12/13, Vulkan, OpenVINO, ROCm và SYCL.
## KIẾN THỨC NỀN
llama.cpp là một khung suy luận mã nguồn mở phổ biến bằng C/C++ được thiết kế để chạy các mô hình ngôn ngữ lớn (LLM) hiệu quả trên nhiều kiến trúc phần cứng khác nhau. Chế độ tải tensor lười (`--tensor-read-lazy`) là tính năng trì hoãn việc đọc một số tensor trọng số mô hình từ các tệp mmap cho đến khi thực sự cần thiết, giúp tiết kiệm bộ nhớ RAM nhưng có thể làm tăng độ trễ truy cập bộ nhớ.