llama.cpp b10996 Sửa Lỗi Đóng Thẻ Suy Luận Cho Qwen3-Coder
Phiên bản llama.cpp b10996 bổ sung bản sửa lỗi (PR #28869) giúp ép buộc chèn thẻ đóng `\n</think>` khi ngân sách suy luận kết thúc trong quá trình chạy mô hình Qwen3-Coder. Nếu không có thẻ đóng phù hợp, giao diện trò chuyện và trình phân tích dữ liệu có thể hiểu sai đầu ra của mô hình hoặc không thể tách biệt chuỗi suy luận với câu trả lời cuối cùng. Bản cập nhật này đảm bảo nhất quán định dạng đầu ra khi chạm giới hạn token suy luận. Bản vá nhắm cụ thể vào hành vi luồng xuất token theo PR #28869 cho trường hợp cạn ngân sách suy luận của Qwen3-Coder. Các tệp thực thi của bản phát hành này được phân phối trên các môi trường macOS, Linux, Windows, Android, CUDA, Vulkan và SYCL.
## KIẾN THỨC NỀN
llama.cpp là một bộ công cụ C/C++ mã nguồn mở hiệu năng cao dùng để chạy các Mô hình Ngôn ngữ Lớn (LLM) cục bộ trên nhiều nền tảng phần cứng khác nhau. Các mô hình suy luận hiện đại sử dụng các thẻ định dạng rõ ràng như `<think>` và `</think>` để đóng gói các bước chuỗi suy luận nội bộ trước khi hiển thị câu trả lời cuối cùng, được kiểm soát bởi giới hạn ngân sách suy luận.