~/LLAMA CPP/llama-cpp-release-b11474-adds-glm5-next-multi-token-prediction-and-optimizes

llama.cpp Phát Hành Bản b11474 Hỗ Trợ Multi-Token Prediction Cho GLM5-Next Và Tối Ưu Hóa Suy Luận

Bản phát hành b11474 của llama.cpp hỗ trợ đồ thị Multi-Token Prediction (MTP) cho mô hình GLM5-Next và tối ưu hóa các lượt lan truyền tiến headless bằng cách cắt gọn đồ thị thực thi. Bản cập nhật cũng cho phép tải các tệp GGUF tách biệt chứa riêng phần MTP hoặc phần thân (trunk) để chạy các mô hình dự thảo hiệu quả. Multi-Token Prediction giúp tăng tốc độ sinh văn bản của LLM bằng cách cho phép mô hình dự đoán nhiều token trong mỗi bước suy luận hoặc vận hành giải mã suy đoán. Bằng cách loại bỏ phép tính thừa trên các hàng đầu ra rỗng khi nạp ngữ cảnh dự thảo, độ trễ thực thi cho lượt catch-up 4 token đã giảm từ 6,9 ms xuống 2,9 ms. Bản cập nhật cắt bỏ đầu ra attention và đầu vào block trước FFN theo từng vị trí và đầu ra dùng chung khi không có hàng đầu ra nào được yêu cầu. Bản nâng cấp này cũng khắc phục các trường hợp biên khi thu hồi chuỗi tái diễn một phần (recurrent rollback) và đảm bảo trích xuất chính xác các hàng ẩn trong quá trình tạo multi-token.

## KIẾN THỨC NỀN

Multi-Token Prediction (MTP) là một hướng kiến trúc trong đó mô hình ngôn ngữ sử dụng các mô-đun phụ trợ để dự đoán đồng thời nhiều token tương lai thay vì chỉ một token tiếp theo. Thiết kế này được sử dụng phổ biến trong giải mã suy đoán (speculative decoding), nơi các đầu dự thảo nhanh chóng tạo ra các token ứng viên để mô hình chính kiểm tra.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama-cpp#llm-inference#performance-optimization#open-source-ai

$ subscribe --daily

llama.cpp Phát Hành Bản b11474 Hỗ Trợ Multi-Token Prediction Cho GLM5-Next Và Tối Ưu Hóa Suy Luận | Daily News