~/LLAMA CPP/llama-cpp-release-b11135-adds-cache-deduplication-for-hugging-face-draft-models

llama.cpp Phát hành Bản b11135 Bổ sung Khử Trùng lặp Bộ nhớ đệm cho Mô hình Draft Hugging Face

llama.cpp đã phát hành bản dựng tự động b11135, mang đến cập nhật cho thành phần server giúp khử trùng lặp các mô hình draft từ Hugging Face bằng cơ chế cache deduplication. Bản phát hành cũng đi kèm sửa lỗi mã nguồn C++ nhằm tránh capture các structured binding bên trong hàm lambda. Thay đổi này giúp tối ưu hóa việc sử dụng bộ nhớ RAM và VRAM bằng cách ngăn việc tải lại mô hình dư thừa khi vận hành suy luận đầu cơ (speculative decoding) với các mô hình draft từ Hugging Face. Điều này giúp duy trì hiệu suất máy chủ khi chạy các hệ thống suy luận LLM đa mô hình. Bản cập nhật khắc phục sự cố #27846 thông qua PR #27934 bằng cách tích hợp `dedup-cache-models` vào thành phần server cho quá trình tải mô hình draft. Nó cũng giải quyết một lỗi biên dịch C++ liên quan đến việc capture structured binding trong các biểu thức lambda.

## KIẾN THỨC NỀN

llama.cpp là một khung mã nguồn mở C/C++ phổ biến phục vụ suy luận LLM hiệu năng cao và tối ưu trên nhiều kiến trúc phần cứng. Kỹ thuật suy luận đầu cơ (speculative decoding) giúp tăng tốc quá trình suy luận LLM bằng cách dùng một mô hình 'draft' nhỏ để tạo nhanh các token ứng viên, sau đó mô hình chính lớn hơn sẽ xác minh song song. Việc quản lý các mô hình draft hiệu quả trong bộ nhớ là yếu tố then chốt để tối đa hóa tốc độ suy luận mà không làm cạn kiệt tài nguyên hệ thống.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama-cpp#llm-inference#open-source-ai#release-notes

$ subscribe --daily

llama.cpp Phát hành Bản b11135 Bổ sung Khử Trùng lặp Bộ nhớ đệm cho Mô hình Draft Hugging Face | Daily News