~/LLAMA CPP/llama-cpp-release-b10830-adds-fuse-qkv-flag-for-hf-to-gguf

llama.cpp Phiên bản b10830 Bổ sung Cờ `--fuse-qkv` khi Chuyển đổi HF sang GGUF

Phiên bản b10830 của llama.cpp giới thiệu cờ dòng lệnh mới `--fuse-qkv` cho kịch bản chuyển đổi mô hình. Cờ này cho phép người dùng hợp nhất các ma trận chiếu Query, Key và Value (Q/K/V) thành một tensor duy nhất khi chuyển đổi mô hình từ Hugging Face sang định dạng GGUF. Việc hợp nhất các ma trận Q/K/V có thể nâng cao hiệu quả sử dụng băng thông bộ nhớ và hiệu suất tính toán trong quá trình tự chú ý khi suy luận LLM. Điều này giúp các nhà phát triển linh hoạt hơn khi tạo các tệp mô hình GGUF được tối ưu hóa cho việc chạy cục bộ. Thay đổi này xuất phát từ pull request #22780 trong kho lưu trữ llama.cpp. Cùng với tùy chọn chuyển đổi mới, bản phát hành b10830 cung cấp các bản dựng sẵn tự động trên nhiều nền tảng như Linux, macOS, Windows, Android và iOS.

## KIẾN THỨC NỀN

llama.cpp là một khung mã nguồn mở viết bằng C/C++ được thiết kế để suy luận LLM hiệu năng cao trên phần cứng phổ thông sử dụng định dạng nhị phân GGUF. Định dạng GGUF lưu trữ cả tensor và siêu dữ liệu trong một tệp duy nhất, chuyển đổi trọng số từ định dạng PyTorch của Hugging Face để có thể tải nhanh chóng.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama-cpp#gguf#llm-inference#open-source-ai

$ subscribe --daily

llama.cpp Phiên bản b10830 Bổ sung Cờ `--fuse-qkv` khi Chuyển đổi HF sang GGUF | Daily News