llama.cpp Phát hành Bản b11025 Mở rộng Hỗ trợ Nemotron Multi-Token Prediction
llama.cpp đã phát hành phiên bản tự động b11025, mở rộng hỗ trợ cho kiến trúc mô hình Multi-Token Prediction (MTP) của NVIDIA Nemotron. Bản cập nhật bao gồm các tinh chỉnh khai báo mã nguồn và cung cấp sẵn bộ cài biên dịch cho macOS, Linux, Windows, Android và iOS. Multi-Token Prediction (MTP) cho phép các mô hình ngôn ngữ dự đoán nhiều token cùng lúc, hoạt động như một kỹ thuật speculative decoding giúp nâng cao tốc độ suy luận. Việc mở rộng hỗ trợ MTP trong llama.cpp giúp người dùng vận hành các mô hình Nemotron hiệu quả hơn trên phần cứng cá nhân. Bản phát hành tích hợp pull request #29018 để khắc phục các chi tiết cài đặt mô hình và loại bỏ các khai báo dư thừa. Các bản biên dịch sẵn hỗ trợ đa dạng môi trường tính toán bao gồm CUDA 12/13, Vulkan, ROCm 10.0, SYCL, OpenVINO và OpenCL.
## KIẾN THỨC NỀN
llama.cpp là một khung suy luận mã nguồn mở viết bằng C/C++ được tối ưu hóa để chạy các mô hình ngôn ngữ lớn trực tiếp trên GPU và CPU cá nhân. Nemotron là dòng mô hình LLM do NVIDIA phát triển, tích hợp các kỹ thuật như Multi-Token Prediction (MTP) nhằm tăng tốc độ tạo token khi suy luận.