~/LLAMA CPP/llama-cpp-release-b11313-re-enables-split-tensor-mode-for-qwen-models

llama.cpp Bản Phát Hành b11313 Bật Lại Chế Độ Split-Tensor Cho Mô Hình Qwen

Bản phát hành b11313 của llama.cpp đã bật lại chế độ split-tensor (`-sm tensor`) cho các kiến trúc mô hình Qwen bằng cách sửa lại việc phân bổ thiết bị backend trong quá trình phân tách đồ thị tính toán. Bản cập nhật này khắc phục lỗi crash assertion ở backend từng xảy ra khi xử lý embedding nằm trên bộ nhớ máy host và các thao tác reshape tensor. Phân tách tensor trên nhiều GPU là tính năng quan trọng để suy luận đa GPU đạt hiệu năng cao trong llama.cpp, giúp tăng đáng kể mức độ sử dụng GPU và tốc độ xử lý. Việc sửa lỗi lập lịch này cho phép người dùng chạy các mô hình dựa trên Qwen trên hệ thống nhiều GPU tận dụng được cơ chế suy luận song song tensor mà không gặp lỗi sập ứng dụng. Vấn đề bắt nguồn từ lỗi assertion (`GGML_ASSERT(ggml_backend_buffer_is_meta)`) khi trình lập lịch đồ thị không thể phân bổ nút `REPEAT` cho thiết bị GPU do bị chặn bởi các nút gather chạy trên CPU. Việc mở rộng `hc_init` ngay sau khi tạo sẽ di chuyển nút này đến trước bước phân bổ thiết bị, tương tự chiến lược triển khai đang dùng cho các mô hình DeepSeek.

## KIẾN THỨC NỀN

llama.cpp là một khung mã nguồn mở phổ biến để chạy các Mô hình Ngôn ngữ Lớn cục bộ trên nhiều phần cứng khác nhau như CPU, CUDA và Vulkan. Thư viện tensor nền tảng của nó, ggml, sử dụng trình lập lịch đồ thị để phân chia đồ thị công việc giữa CPU của máy host và các bộ tăng tốc phần cứng hoặc giữa nhiều GPU ở chế độ split-tensor.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama-cpp#llm-inference#open-source-ai#cpp

$ subscribe --daily

llama.cpp Bản Phát Hành b11313 Bật Lại Chế Độ Split-Tensor Cho Mô Hình Qwen | Daily News