Bản phát hành llama.cpp b11169 sửa lỗi xén số khi phân tích token_id trong llama-grammar
Khung làm việc suy luận LLM nguồn mở llama.cpp đã phát hành bản vá b11169. Bản cập nhật này khắc phục sự cố xén số (numeric truncation) trong quá trình phân tích token_id bên trong mô-đun llama-grammar (PR #29382). Việc khắc phục lỗi xén số giúp ngăn ngừa các lỗi phân tích khi áp dụng quy tắc ngữ pháp trên các mô hình LLM hiện đại có tập từ vựng lớn. Điều này đảm bảo việc tạo văn bản có cấu trúc (như đầu ra JSON) đạt độ tin cậy cao trong quá trình giải mã có ràng buộc. Bản vá tập trung cụ thể vào logic phân tích token ID trong thành phần `llama-grammar`. Các tệp thực thi biên dịch sẵn đã được cập nhật cho tất cả nền tảng hỗ trợ như macOS, Linux, Windows và Android.
## KIẾN THỨC NỀN
`llama.cpp` là thư viện C/C++ phổ biến được thiết kế để suy luận LLM hiệu năng cao trên nhiều nền tảng phần cứng khác nhau. Tính năng `llama-grammar` của thư viện sử dụng các quy tắc GBNF (GGML Backus-Naur Form) để ràng buộc quá trình lấy mẫu của mô hình, buộc đầu ra phải tuân thủ nghiêm ngặt các định dạng đã định nghĩa như JSON hợp lệ hoặc cú pháp tùy chỉnh.