llama.cpp Phát Hành Bản b10771 Tái Cấu Trúc API Tokenization Đa Mô Thức
Bản phát hành b10771 của llama.cpp bổ sung hàm `mtmd_tokenize_from_parts()` nhằm cải thiện việc xử lý tách từ (tokenization) trong các luồng công việc đa mô thức. Bản cập nhật sửa đổi công cụ `mtmd-cli` để áp dụng API mới này và chuyển cấu hình `add_special` token lên cấp độ lời gọi hàm. Mặc dù đây là một bản phát hành bảo trì nhỏ, nó tinh chỉnh thiết kế API nội bộ để xử lý các prompt có cấu trúc gồm nhiều loại nội dung như văn bản, hình ảnh hoặc âm thanh. Các nhà phát triển mở rộng tính năng đa mô thức của llama.cpp sẽ có khả năng kiểm soát việc tạo token và xử lý các token đặc biệt một cách mạch lạc hơn. Được triển khai trong PR #28250, `mtmd_tokenize_from_parts()` cho phép tách từ các phần riêng biệt của một prompt theo thứ tự. Việc chuyển `add_special` lên cấp độ lời gọi hàm giúp người gọi kiểm soát chi tiết hơn về việc có đính kèm các token đặc biệt trong từng lượt tách từ hay không.
## KIẾN THỨC NỀN
llama.cpp là một bộ khung mã nguồn mở C/C++ được sử dụng rộng rãi để chạy suy luận LLM hiệu quả trên nhiều kiến trúc CPU và GPU khác nhau. Trong hệ sinh thái llama.cpp, `mtmd` đại diện cho các công cụ CLI đa mô thức được thiết kế để xử lý các đầu vào hỗn hợp như văn bản, hình ảnh và âm thanh trước khi gửi tới mô hình. Tokenization (tách từ) là bước phân tách các đầu vào này thành các mã ID dạng số tương thích với mô hình.