Tái khởi động phát triển Multi-Token Prediction cho Qwen Flash Next trong llama.cpp
Quá trình phát triển tính năng hỗ trợ Multi-Token Prediction (MTP) cho các mô hình Qwen Flash Next trong llama.cpp đã được khởi động lại. Các bản định lượng GGUF cập nhật hiện đã có trên Hugging Face cùng với một pull request đang hoạt động trên GitHub. Tích hợp hỗ trợ MTP vào llama.cpp giúp tăng tốc độ suy luận và cải thiện khả năng sinh văn bản cho các mô hình Qwen chạy cục bộ. Cập nhật này cho phép người dùng AI mã nguồn mở thử nghiệm các kỹ thuật giải mã tiên tiến trên phần cứng cá nhân. Tính năng này hiện vẫn đang trong quá trình phát triển (WIP) và được theo dõi tại GitHub PR #29761. Các mô hình để thử nghiệm có thể tải về từ kho Hugging Face `ggml-org/Qwen3.8-Flash-Next-GGUF`.
## KIẾN THỨC NỀN
Multi-Token Prediction (MTP) là một kiến trúc trong đó mô hình LLM dự đoán đồng thời nhiều token tiếp theo thay vì chỉ dự đoán một token theo chuỗi, giúp tăng tốc suy luận và giải mã đầu cơ. llama.cpp là một công cụ thực thi C/C++ phổ biến sử dụng định dạng tệp GGUF để chạy hiệu quả các LLM đã định lượng trên thiết bị cục bộ.