~/LLM INFERENC/llama-cpp-releases-build-b10150-with-backend-offloading-adjustments

llama.cpp Phát Hành Bản Dựng b10150 Với Các Điều Chỉnh Offload Backend

llama.cpp đã phát hành bản dựng b10150, giới thiệu các điều chỉnh đối với logic chuyển tải (offloading) các phép toán sang backend của trọng số trong thư viện ggml. Ngoài ra, bản phát hành này cũng sửa lỗi cho các đồ thị dsv4 và tạm tắt hỗ trợ KleidiAI cho các bản dựng macOS Apple Silicon. Mặc dù đây là một bản cập nhật định kỳ, việc tối ưu hóa logic offload sang backend giúp cải thiện hiệu suất sử dụng tài nguyên phần cứng khi suy luận LLM cục bộ. Đảm bảo tính ổn định trong các đồ thị tính toán như dsv4 giúp ngăn ngừa lỗi khi chạy các mô hình tương thích trên nhiều cấu hình phần cứng khác nhau. Bản phát hành này bao gồm các tệp thực thi được biên dịch sẵn cho nhiều nền tảng, bao gồm Windows (hỗ trợ CUDA 12/13, Vulkan và SYCL), Linux, Android và macOS. Tuy nhiên, bản dựng macOS Apple Silicon kích hoạt KleidiAI đã bị vô hiệu hóa trong phiên bản này.

## KIẾN THỨC NỀN

llama.cpp là một công cụ suy luận hiệu năng cao, mã nguồn mở phổ biến được viết bằng C/C++, cho phép người dùng chạy các Mô hình Ngôn ngữ Lớn (LLM) cục bộ. Dự án này dựa trên thư viện tensor ggml để quản lý các phép toán học máy và tối ưu hóa việc thực thi trên nhiều backend phần cứng khác nhau như CPU và GPU.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM Inference#llama.cpp#Open Source#AI Infrastructure

$ subscribe --daily

llama.cpp Phát Hành Bản Dựng b10150 Với Các Điều Chỉnh Offload Backend | Daily News