llama.cpp b11412 Khắc Phục Lỗi Tái Cấp Phát Đồ Thị Tính Toán Trong Các Mô Hình K-Pool
Bản phát hành b11412 của llama.cpp giải quyết sự cố trong đó các mô hình kiến trúc k-pool, bao gồm Qwen4exp và GLM5-next, kích hoạt việc tái cấp phát đồ thị ngoài dự kiến khi suy luận. Bản sửa lỗi này duy trì cấu trúc đồ thị tính toán nhất quán giữa các trạng thái thực thi bằng cách loại bỏ các nhánh điều kiện động dựa trên trạng thái chia sẻ chuỗi. Việc tái cấp phát đồ thị ngoài dự kiến làm giảm hiệu suất suy luận và gây ra lỗi dừng chương trình trong các chế độ kiểm tra bộ nhớ nghiêm ngặt như GGML_SCHED_DEBUG_REALLOC=1. Việc đảm bảo hình dạng đồ thị cố định giúp llama.cpp duy trì hiệu năng cao và mức tiêu thụ bộ nhớ ổn định khi xử lý đa chuỗi theo lô. Bản vá loại bỏ sự phụ thuộc vào API đồ thị động get_kpool_cache_safe và cập nhật các mô hình để luôn sử dụng ranh giới cố định cho các thao tác scatter và gather. Ngoài ra, nó khắc phục lỗi giảm trọng số CUDA MoE khi các ubatch rỗng làm mất các phụ thuộc cấp phát và gây lệch số lượng nút.
## KIẾN THỨC NỀN
llama.cpp dựa vào trình cấp phát bộ nhớ của GGML, vốn cấp phát trước bộ nhớ cho toàn bộ ngữ cảnh dựa trên đồ thị tính toán trường hợp xấu nhất nhằm tránh chi phí cấp phát trong quá trình giải mã. Nếu cấu trúc đồ thị thay đổi động khi chạy do số lượng token hoặc trạng thái chuỗi biến đổi, bộ lập lịch buộc phải tái cấp phát bộ nhớ ngay giữa quá trình thực thi.