Chạy LLM 27B với ngữ cảnh 262K và ~130 tok/s trên một card RTX 4090
Một nhà phát triển đã tạo công cụ chuyển đổi và tích hợp cho công cụ suy luận C++/CUDA NInfer, cho phép mô hình Qwen3.8-27B uncensored chạy trên một GPU RTX 4090 duy nhất. Cấu hình tối ưu này đạt tốc độ sinh văn bản ~130 token/giây trên toàn bộ cửa sổ ngữ cảnh 262K gốc nhờ kỹ thuật Dự đoán Đa Token (MTP3). Thành tựu này chứng minh rằng việc suy luận tốc độ cao cho các mô hình 27B với ngữ cảnh siêu dài là hoàn toàn khả thi trên phần cứng tiêu dùng cao cấp. Nhờ vượt trội đáng kể so với các công cụ đa năng như llama.cpp, kết quả này khẳng định tiềm năng hiệu năng của các engine CUDA chuyên dụng kết hợp với kỹ thuật suy đoán token. Cấu hình sử dụng kỹ thuật suy luận dự đoán MTP3 với tỷ lệ chấp nhận token 70,8% và đạt tốc độ prefill 3.591 token/giây trên prompt 9K. Độ chính xác của mô hình được duy trì cao khi độ hoang mang (perplexity) chỉ chênh lệch trong khoảng 1,3% so với mô hình gốc, đồng thời tính năng thị giác và gọi công cụ vẫn hoạt động bình thường.
## KIẾN THỨC NỀN
NInfer là một công cụ suy luận C++/CUDA chuyên dụng được thiết kế nhằm đạt hiệu năng tối đa trên một GPU thuộc dòng phần cứng tiêu dùng như NVIDIA RTX. Dự đoán Đa Token (MTP) là một hình thức suy luận dự đoán (speculative decoding), trong đó mô hình ngôn ngữ tự dự đoán trước nhiều token tiếp theo trong mỗi bước, giúp tăng tốc sinh văn bản mà không cần mô hình nháp riêng biệt.