Bản phát hành llama.cpp b10247 khắc phục lỗi crash cho các mô hình MoE lớn
Dự án llama.cpp đã phát hành phiên bản build b10247, giới thiệu cơ chế cấp phát động cho các đầu vào đồ thị phân tách (split graph inputs) trong bộ lập lịch backend của ggml. Bản cập nhật này thay thế các mảng có kích thước cố định nhằm ngăn chặn tình trạng crash khi tải các mô hình Mixture of Experts (MoE) lớn như DeepSeek, Mixtral và Qwen MoE trên các cấu hình đa backend. Bản phát hành này cải thiện độ ổn định khi chạy các mô hình MoE hiện đại, kích thước lớn trên các thiết lập phần cứng hỗn hợp, chẳng hạn như kết hợp backend CPU và GPU. Bằng cách loại bỏ các giới hạn cứng về tensor đầu vào, người dùng có thể chạy các mô hình lớn hơn mà không gặp phải lỗi crash liên quan đến bộ nhớ trong quá trình lập lịch đồ thị. Cụ thể, bản cập nhật thay thế mảng kích thước cố định GGML_SCHED_MAX_SPLIT_INPUTS bằng các bộ đệm động tự động mở rộng khi cần cho split->inputs và sched->graph_inputs. Điều này giải quyết các sự cố xảy ra khi các phân tách đồ thị vượt quá giới hạn cứng 30 tensor đầu vào trước đây.
## KIẾN THỨC NỀN
llama.cpp là một thư viện mã nguồn mở được thiết kế để suy luận LLM hiệu năng cao, sử dụng thư viện tensor ggml để chạy các mô hình một cách hiệu quả trên phần cứng phổ thông. Mixture of Experts (MoE) là một kiến trúc AI phân chia khối lượng công việc của mô hình cho các mạng con 'chuyên gia' chuyên biệt, thường đòi hỏi phải xử lý đồng thời một số lượng lớn các tensor đầu vào trong quá trình thực thi.