llama.cpp Bản phát hành b11318 Sửa Lỗi Cấu hình Tokenizer cho Mô hình PLaMo-2 và PLaMo-3
llama.cpp bản phát hành b11318 đã cập nhật cách xử lý từ vựng để ghi nhận và tuân thủ chính xác các thông số metadata BOS (bắt đầu chuỗi) và EOS (kết thúc chuỗi) cho các mô hình PLaMo-2 và PLaMo-3. Bản sửa lỗi này đảm bảo các cờ cấu hình như `add_bos_token: true` và `add_eos_token: false` được áp dụng đúng trong quá trình chuyển đổi mô hình và phân tách từ. Cấu hình metadata chuẩn xác trong quá trình tokenization giúp việc suy luận LLM tạo ra phản hồi chính xác mà không gặp lỗi định dạng hay lệch token ngoài ý muốn. Bản sửa lỗi này giải quyết sự bất đồng trong việc xử lý câu lệnh khi chạy các mô hình PLaMo tiếng Nhật trên llama.cpp. Trước đây, hàm `_set_vocab_plamo()` đã bỏ qua metadata BOS/EOS, khiến logic tokenization của PLAMO2 không áp dụng các tham số `add_bos` và `add_eos`. Các tệp GGUF hiện có thiếu những khóa metadata này vẫn giữ nguyên hành vi trước đó để đảm bảo tính tương thích ngược.
## KIẾN THỨC NỀN
llama.cpp là một bộ khung suy luận C/C++ mã nguồn mở được thiết kế để chạy các mô hình ngôn ngữ lớn cục bộ bằng định dạng tệp GGUF. Các token đặc biệt như BOS và EOS là những dấu mốc quan trọng giúp bộ tách từ nhận biết điểm bắt đầu và kết thúc tạo văn bản. PLaMo là dòng mô hình ngôn ngữ thế hệ mới do Preferred Networks (PFN) phát triển, tập trung mạnh vào các tác vụ tiếng Nhật.