~/LLAMA CPP/llama-cpp-b10645-released-with-cpu-offloading-for-dense-ffn-weights

llama.cpp b10645 hỗ trợ offload trọng số FFN sang CPU

Dự án llama.cpp đã phát hành phiên bản b10645, giới thiệu tùy chọn dòng lệnh `--n-cpu-ffn`. Tính năng mới này cho phép người dùng chuyển (offload) các trọng số mạng truyền thẳng (FFN) dày đặc của N lớp đầu tiên trong mô hình sang CPU. Tính năng này giúp tối ưu hóa việc sử dụng bộ nhớ trong quá trình suy luận LLM, cho phép người dùng chạy các mô hình lớn hơn trên phần cứng có VRAM GPU hạn chế bằng cách tận dụng RAM hệ thống. Nó cung cấp khả năng kiểm soát chi tiết hơn đối với việc phân bổ tài nguyên giữa CPU và GPU. Bản phát hành này cũng loại bỏ các vòng lặp ghi đè trùng lặp cho `--n-cpu-moe` và `--spec-draft-n-cpu-moe`, đồng thời tổng quát hóa khối biểu thức chính quy (regex) của FFN. Các bản dựng nhị phân hiện đã có sẵn cho nhiều nền tảng bao gồm macOS, Linux, Windows và Android.

## KIẾN THỨC NỀN

llama.cpp là một công cụ suy luận LLM mã nguồn mở phổ biến được thiết kế để thực thi hiệu quả các mô hình trên máy cục bộ. Trong các mô hình ngôn ngữ lớn (LLM), mạng truyền thẳng (FFN) chiếm một phần đáng kể trong các tham số (trọng số) của mô hình. Kỹ thuật offload sang CPU (CPU offloading) giúp chuyển tạm thời một phần các trọng số hoặc tính toán này từ VRAM của GPU sang bộ nhớ hệ thống của CPU để tránh lỗi thiếu bộ nhớ (out-of-memory).

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama.cpp#LLM Inference#AI Infrastructure#Open Source

$ subscribe --daily

llama.cpp b10645 hỗ trợ offload trọng số FFN sang CPU | Daily News