Phát Hành llama.cpp b11100 Sửa Lỗi Phân Tích Tool-Call Cho Muse Glimmer
Bản phát hành llama.cpp b11100 khắc phục lỗi phân tích gọi công cụ (tool-call) trong chế độ chat khi xử lý lần gọi đầu tiên của dòng mô hình Muse Glimmer. Bản cập nhật này cũng cung cấp các tệp thực thi biên dịch sẵn cho nhiều nền tảng như macOS, Windows, Linux, Android và Snapdragon. Bản vá này khôi phục khả năng thực thi gọi hàm (function-calling) ổn định cho các nhà phát triển xây dựng đại lý AI tự chủ với mô hình Muse Glimmer qua llama.cpp. Nó đảm bảo tính tương thích mượt mà và khả năng cung cấp bản biên dịch sẵn trên nhiều nền tảng phần cứng từ thiết bị biên đến các hệ thống hiệu năng cao. Sửa lỗi này cô đọng các mẫu kích hoạt và bổ sung bài kiểm tra tự động trong PR #29242 nhằm đảm bảo trình phân tích tool-call hoạt động chính xác ở chế độ chat. Các tệp thực thi đi kèm hỗ trợ nhiều backend tăng tốc như CUDA 12/13, Vulkan, ROCm 10.0, OpenVINO, SYCL và phần cứng Snapdragon.
## KIẾN THỨC NỀN
llama.cpp là một công cụ C/C++ mã nguồn mở phổ biến được thiết kế để chạy suy luận mô hình ngôn ngữ lớn (LLM) cục bộ hiệu quả trên nhiều loại phần cứng. Tính năng gọi công cụ (tool calling hoặc function calling) cho phép LLM định dạng câu trả lời để các hệ thống bên ngoài có thể thực thi mã hoặc truy vấn API. Muse Glimmer là mô hình được tối ưu hóa riêng cho các tác vụ tự chủ và sử dụng công cụ.