~/LLAMA CPP/llama-cpp-release-b11034-adds-support-for-ufakzeka-pre-tokenizer

llama.cpp Phát hành Phiên bản b11034 Bổ sung Hỗ trợ Pre-Tokenizer ufakzeka

llama.cpp bản dựng b11034 đã được phát hành, bổ sung khả năng hỗ trợ pre-tokenizer ufakzeka trong quy trình xử lý từ vựng. Bản cập nhật này tích hợp pre-tokenizer vào danh sách mô hình của dự án và tạo lại các ánh xạ mã băm (hash mapping). Việc bổ sung hỗ trợ cho các pre-tokenizer chuyên biệt đảm bảo llama.cpp có thể phân tách từ văn bản đầu vào một cách chính xác cho các mô hình ngôn ngữ mới sử dụng quy tắc phân tách từ vựng tùy chỉnh. Điều này giúp duy trì tính tương thích trên hệ sinh thái mô hình ngôn ngữ lớn (LLM) mã nguồn mở đang phát triển nhanh chóng. Được triển khai trong pull request #29033, bản cập nhật đã thêm pre-tokenizer ufakzeka vào mã xử lý từ vựng. Các bản biên dịch sẵn (binary) đã được phát hành cho nhiều nền tảng và backend khác nhau, bao gồm Linux, Windows, macOS, Android, iOS, CUDA và Vulkan.

## KIẾN THỨC NỀN

llama.cpp là một thư viện mã nguồn mở C/C++ phổ biến để chạy suy luận LLM một cách hiệu quả trên phần cứng cục bộ. Pre-tokenizer là giai đoạn đầu trong quy trình mã hóa văn bản (tokenization), có nhiệm vụ chia chuỗi thô thành các từ hoặc đoạn nhỏ hơn trước khi chuyển đổi chúng thành mã định danh token dạng số.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama.cpp#LLM#AI Infrastructure#Open Source

$ subscribe --daily

llama.cpp Phát hành Phiên bản b11034 Bổ sung Hỗ trợ Pre-Tokenizer ufakzeka | Daily News