~/LLAMA CPP/llama-cpp-release-b11026-adds-tensor-skipping-fix-for-qwen-moe-models

llama.cpp Phát Hành Phiên Bản b11026 Bổ Sung Sửa Lỗi Bỏ Qua Tensor Cho Mô Hình Qwen MoE

llama.cpp đã phát hành bản dựng b11026, mang đến bản sửa lỗi để bỏ qua các tensor `gate_up_exps` khi thuộc tính `TENSOR_SKIP` được thiết lập trong cấu hình mô hình Qwen MoE. Sự thay đổi này là cần thiết cho các kiến trúc như Qwen 3.5 MoE khi các tensor Multi-Token Prediction (MTP) được hợp nhất nhưng không được tải trong quá trình suy luận. Cập nhật này giúp ngăn ngừa lỗi tải tensor và chi phí bộ nhớ không mong muốn khi thực thi các biến thể Qwen Mixture-of-Experts (MoE) hiện đại trên máy cục bộ. Nó nâng cao tính tương thích khi các kiến trúc LLM nguồn mở áp dụng những tính năng tiên tiến như Multi-Token Prediction. Thay đổi này, được triển khai qua PR #29014, đảm bảo các tensor `gate_up_exps` được bỏ qua khi cờ `TENSOR_SKIP` được bật. Các bản dựng sẵn được phát hành cho macOS, Linux, Windows và Android trên nhiều nền tảng phần cứng bao gồm CPU, CUDA 12/13, Vulkan, ROCm và SYCL.

## KIẾN THỨC NỀN

llama.cpp là một bộ công cụ suy luận viết bằng C/C++ được sử dụng rộng rãi để chạy các Mô hình Ngôn ngữ Lớn (LLM) hiệu quả trên phần cứng phổ thông. Các mô hình Mixture-of-Experts (MoE) định tuyến token qua các mạng con chuyên biệt gọi là chuyên gia, trong khi Multi-Token Prediction (MTP) là kỹ thuật cho phép mô hình dự đoán nhiều token trong một lượt xử lý để tăng tốc độ suy luận.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama-cpp#llm-inference#open-source-ai#release-notes

$ subscribe --daily

llama.cpp Phát Hành Phiên Bản b11026 Bổ Sung Sửa Lỗi Bỏ Qua Tensor Cho Mô Hình Qwen MoE | Daily News