llama.cpp Phát Hành Phiên Bản b10199 Hỗ Trợ Input Embedding Để Tạo Token Tiếp Theo
Dự án llama.cpp đã phát hành phiên bản build b10199, giới thiệu tính năng hỗ trợ sử dụng input embedding để tạo token tiếp theo trong thành phần máy chủ (server component). Bản phát hành này cũng bao gồm bản sửa lỗi cho hàm hủy batch của máy chủ và cập nhật các tệp thực thi cho nhiều nền tảng khác nhau. Bản cập nhật này cho phép máy chủ llama.cpp chấp nhận trực tiếp các vector embedding thô làm đầu vào để tạo văn bản, giúp tích hợp linh hoạt hơn với các luồng xử lý embedding thượng nguồn hoặc hệ thống tạo truy xuất tăng cường (RAG). Nó tối ưu hóa quy trình làm việc khi các token đã được chuyển đổi thành embedding trước khi gửi đến máy chủ suy luận. Tính năng này được triển khai thông qua pull request #26313, cụ thể là bổ sung hỗ trợ embedding cho các token được lấy mẫu và sửa lỗi hủy batch của máy chủ. Các bản dựng sẵn được cung cấp cho nhiều nền tảng, mặc dù tính năng tăng tốc KleidiAI cho macOS Apple Silicon vẫn bị vô hiệu hóa trong bản dựng này.
## KIẾN THỨC NỀN
llama.cpp là một công cụ suy luận LLM mã nguồn mở phổ biến được viết bằng C/C++, cho phép chạy hiệu quả các mô hình như LLaMA trên thiết bị cục bộ. Thông thường, các LLM xử lý văn bản bằng cách trước tiên chuyển đổi nó thành các token, sau đó được ánh xạ thành các biểu diễn vector đa chiều gọi là token embedding. Bằng cách cho phép máy chủ chấp nhận trực tiếp các embedding này, các nhà phát triển có thể bỏ qua bước phân tách token (tokenization) ban đầu hoặc truyền vào các embedding tùy chỉnh được tạo bởi các mô hình bên ngoài.