~/LLAMA CPP/llama-cpp-releases-build-b10197-with-alternative-convolution-layout-test-support

llama.cpp Phát Hành Bản Dựng b10197 Hỗ Trợ Thử Nghiệm Bố Cục Phép Cuộn Thay Thế

Dự án llama.cpp đã phát hành bản dựng b10197, giới thiệu hỗ trợ thử nghiệm cho các bố cục phép cuộn (convolution layout) thay thế (như cwhn) và bổ sung các kiểm tra bố cục trong quá trình dựng đồ thị. Bản cập nhật này cũng bao gồm các tinh chỉnh cho các backend Vulkan, CUDA và CPU nhằm ngăn chặn lỗi runtime và đảm bảo lưu trữ bộ nhớ liên tục. Bản phát hành này cải thiện độ tin cậy của các phép toán tensor trên llama.cpp đối với các backend phần cứng khác nhau bằng cách đảm bảo các bố cục bộ nhớ thay thế được xác thực chính xác. Việc hỗ trợ tốt hơn cho các bố cục phép cuộn đa dạng có thể giúp tối ưu hóa hiệu suất tăng tốc phần cứng trên GPU (như CUDA và Vulkan) và CPU. Bản cập nhật giới thiệu một kiểm tra mới trong quá trình dựng đồ thị tại `ggml_backend_vk_device_supports_op` để giải quyết các lỗi assert runtime của Vulkan và các sự cố CI. Ngoài ra, các kernel của backend CPU hiện phải được lưu trữ liên tục khi `cwhn=1` để tránh lỗi trong quá trình chạy thử nghiệm.

## KIẾN THỨC NỀN

llama.cpp là một công cụ suy luận mã nguồn mở được thiết kế để chạy các mô hình ngôn ngữ lớn một cách hiệu quả trên phần cứng phổ thông bằng thư viện tensor ggml. Các phép toán cuộn (convolution) trong mạng thần kinh xử lý dữ liệu đa chiều (tensor), và cách sắp xếp các chiều này trong bộ nhớ (bố cục/layout) ảnh hưởng đáng kể đến tốc độ thực thi phần cứng trên các nền tảng như CUDA và Vulkan.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama.cpp#AI/ML#Open Source#GPU Acceleration

$ subscribe --daily

llama.cpp Phát Hành Bản Dựng b10197 Hỗ Trợ Thử Nghiệm Bố Cục Phép Cuộn Thay Thế | Daily News