llama.cpp Phát hành Bản b11124 Sửa Lỗi Thực Thi Top-k MoE Trên CUDA
llama.cpp đã phát hành bản cập nhật b11124, mang đến sửa lỗi cho backend CUDA nhằm đảm bảo các kernel Mixture of Experts (MoE) top-k luôn được kích hoạt chính xác trong quá trình thực thi. Thay đổi này khắc phục PR #28432 khi cơ chế định tuyến top-k của MoE có thể không được kích hoạt đúng cách. Bản sửa lỗi này đảm bảo tính toán và định tuyến chính xác cho các kiến trúc MoE, như các mô hình Mixtral hoặc DeepSeek, khi chạy trên GPU NVIDIA qua CUDA. Việc định tuyến chuyên gia không ổn định có thể dẫn đến lỗi ẩn hoặc đầu ra suy luận không chính xác. Bản sửa lỗi tập trung vào logic thực thi CUDA dành riêng cho việc lựa chọn chuyên gia top-k trong các mô hình MoE. Bản phát hành b11124 cũng đi kèm các tệp thực thi biên dịch sẵn cho nhiều hệ điều hành và kiến trúc, bao gồm Linux CUDA 12/13, Windows, macOS, Android và thiết bị Snapdragon.
## KIẾN THỨC NỀN
llama.cpp là một khung C/C++ mã nguồn mở hiệu năng cao dùng để chạy các mô hình ngôn ngữ lớn (LLM) cục bộ trên nhiều loại phần cứng khác nhau. Mixture of Experts (MoE) là một kiến trúc mạng thần kinh dựa vào cơ chế định tuyến top-k để chỉ chuyển token đến một nhóm nhỏ các mạng con chuyên biệt ('expert') thay vì kích hoạt toàn bộ mô hình cho mỗi token.