~/LLAMA CPP/llama-cpp-release-b11057-adds-dedicated-chat-parser-for-ling-3-0

llama.cpp Bản Phát Hành b11057 Bổ Sung Bộ Phân Tích Trò Chuyện Riêng Cho Ling 3.0 (Bailing V3)

Bản phát hành b11057 của llama.cpp bổ sung bộ phân tích trò chuyện (chat parser) chuyên dụng cho dòng mô hình Ling 3.0 (Bailing V3) nhằm xử lý chính xác các lệnh gọi công cụ nằm trong khối suy luận. Bộ phân tích mới kết thúc đầu ra suy luận khi gặp thẻ đóng `</think>` hoặc ngay khi bắt đầu xuất hiện thẻ `<tool_call>`. Trước đó, các mô hình Ling 3.0 chạy trên llama.cpp không thể thực thi lệnh gọi công cụ do khối suy luận chưa đóng khiến các lệnh này bị phân loại nhầm thành văn bản thuần túy, làm gián đoạn vòng lặp của agent. Việc đồng bộ logic phân tích của llama.cpp với các khung như vLLM và SGLang giúp khôi phục hoàn toàn khả năng gọi hàm của Ling 3.0. Mẫu prompt của Ling 3.0 Flash mở sẵn thẻ `<think>` mà không xuất thẻ mở rõ ràng, khiến thẻ `<tool_call>` có thể xuất hiện trước thẻ `</think>`. Việc nhận diện bộ phân tích chuyên dụng này được kiểm soát an toàn nhờ các thẻ đánh dấu phần `<role>...</role>` đặc trưng của dòng mô hình Ling 3.0.

## KIẾN THỨC NỀN

llama.cpp là công cụ suy luận LLM mã nguồn mở phổ biến được viết bằng C/C++ giúp chạy mô hình hiệu quả trên nhiều loại phần cứng. Các mô hình suy luận hiện đại sử dụng các thẻ cấu trúc như `<think>` và `<tool_call>` để tách biệt các bước suy nghĩ nội bộ với lệnh gọi hàm, đòi hỏi bộ phân tích chuyên biệt để chuyển hướng token chính xác đến ứng dụng agent.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama.cpp#LLM#AI Infrastructure#Open Source

$ subscribe --daily

llama.cpp Bản Phát Hành b11057 Bổ Sung Bộ Phân Tích Trò Chuyện Riêng Cho Ling 3.0 (Bailing V3) | Daily News