llama.cpp b11530 khắc phục lỗi hủy tiến trình do cấp phát lại đồ thị lấy mẫu
Bản phát hành b11530 của llama.cpp cập nhật logic lấy mẫu backend để giữ cấu trúc đồ thị tính toán cố định qua các micro-batch. Thay đổi này ngăn ngừa sự cố hủy tiến trình khi chạy với cờ lập lịch GGML_SCHED_NO_REALLOC. Duy trì đồ thị tính toán cố định là yếu tố then chốt giúp quản lý bộ nhớ dự đoán được và đạt hiệu suất cao trên các backend phần cứng trong quá trình suy luận LLM. Việc loại bỏ sự thay đổi cấu trúc đồ thị giữa các giai đoạn cấp phát bộ nhớ và giải mã giúp tiến trình suy luận hoạt động ổn định mà không cần cấp phát lại bộ nhớ. Trước đây, giai đoạn dự trữ bộ nhớ tạo n_outputs_max_per_seq chuỗi lấy mẫu trong khi bước giải mã chỉ tạo một chuỗi cho mỗi hàng đầu ra, làm thay đổi cấu trúc đồ thị và gây ra lỗi GGML_SCHED_NO_REALLOC. Hiện tại, các bộ lấy mẫu sẽ nhất quán dựng đủ n_outputs_max_per_seq chuỗi bằng cách gán các ô ubatch không được chọn vào hàng đệm, cho phép graph_max_nodes đếm chính xác.
## KIẾN THỨC NỀN
llama.cpp là một bộ khung C/C++ phổ biến dùng để chạy các Mô hình Ngôn ngữ Lớn hiệu quả trên phần cứng người dùng. Trong quá trình suy luận, các bước tính toán được dựng thành một đồ thị vận hành, trong đó các vùng đệm bộ nhớ có thể được cấp phát động hoặc cố định bởi bộ lập lịch GGML.