~/LLAMA CPP/llama-cpp-b11294-release-adds-row-prefetching-for-lazy-model-loading

Phiên bản llama.cpp b11294 bổ sung hỗ trợ row prefetching cho lazy model loading

Dự án llama.cpp đã phát hành phiên bản b11294, bổ sung tính năng nạp trước hàng tensor (llama_prefetch_rows) khi tải mô hình ở chế độ lười (lazy loading), bao gồm hỗ trợ trên Windows. Bản cập nhật này cũng dọn dẹp cấu trúc mã nguồn và làm rõ định nghĩa token đệm (padding token) cho các mô hình Gemma 4. Việc nạp trước các hàng tensor giúp tối ưu hóa truy xuất bộ nhớ khi tải mô hình ở chế độ lười (lazy loading), từ đó giảm độ trễ và hạn chế nghẽn I/O khi chạy các mô hình ngôn ngữ lớn (LLM). Việc mở rộng tính năng này sang Windows giúp đảm bảo hiệu năng đồng nhất trên các hệ điều hành phổ biến. Tính năng prefetch hàng chỉ được bật khi chạy ở chế độ lazy mode và được chuyển hướng qua llama-impl thay vì để lộ trực tiếp llama-mmap vào mã nguồn mô hình. Bản đóng góp cho Windows do nhà phát triển @praneshgo thực hiện, đi kèm với các chỉnh sửa xây dựng hệ thống và điều chỉnh token cho Gemma 4.

## KIẾN THỨC NỀN

llama.cpp là một thư viện C/C++ mã nguồn mở phổ biến giúp chạy suy luận hiệu quả các mô hình ngôn ngữ lớn (LLM) trên phần cứng cục bộ. Chế độ tải mô hình lười (lazy loading) hoãn việc đọc trọng số mô hình vào bộ nhớ cho đến khi thực sự cần thiết, trong khi kỹ thuật prefetching chủ động tải trước dữ liệu sắp dùng để tránh gián đoạn hiệu năng.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama-cpp#LLM#AI Infrastructure#Software Release

$ subscribe --daily

Phiên bản llama.cpp b11294 bổ sung hỗ trợ row prefetching cho lazy model loading | Daily News