llama.cpp Bản dựng b11330 Bổ sung Hỗ trợ Dự đoán Đa Token cho Qwen4Exp
Dự án llama.cpp đã phát hành bản dựng b11330, bổ sung hỗ trợ tính năng Dự đoán Đa Token (Multi-Token Prediction - MTP) cho các mô hình Qwen4Exp. Bản cập nhật này cũng tái cấu trúc việc kiểm tra bộ đệm ngữ cảnh và dọn dẹp các cấu trúc bộ nhớ tuần hoàn. Tính năng Dự đoán Đa Token cho phép các mô hình ngôn ngữ lớn tạo ra nhiều token trong một lượt xử lý (forward pass), giúp tăng đáng kể tốc độ suy luận trên phần cứng địa phương. Việc mở rộng MTP sang các biến thể kiến trúc Qwen thử nghiệm giúp các công cụ suy luận nguồn mở vận hành hiệu quả những kiến trúc mô hình tối ưu hiện đại. Pull request #29761 triển khai MTP cho Qwen4Exp bằng cách thay thế việc kiểm tra `has_state` bằng cách xác minh bộ đệm `ctx_bufs` không rỗng, đồng thời làm sạch các chú thích mã nguồn và xử lý bộ nhớ tuần hoàn. Các tệp thực thi đã biên dịch sẵn cho bản dựng b11330 hiện khả dụng trên nhiều nền tảng bao gồm macOS, Linux (CUDA 12/13, ROCm, Vulkan, OpenVINO, SYCL, Snapdragon), Windows và Android.
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ lớn (LLM) tiêu chuẩn thường sinh văn bản theo cơ chế tự hồi quy thông qua việc dự đoán token tiếp theo, tức chỉ tạo một token tại mỗi lượt xử lý. Dự đoán Đa Token (MTP) là một kỹ thuật suy luận giúp dự đoán đồng thời nhiều token, qua đó giảm độ trễ khi giải mã. llama.cpp là một thư viện suy luận C/C++ nguồn mở phổ biến, được thiết kế để thực thi LLM hiệu quả trên thiết bị cá nhân qua nhiều môi trường phần cứng CPU và GPU.