~/LLM INFERENC/exllamav3-and-exl3-deliver-high-benchmark-speeds-for-local-llm-flash-next

ExllamaV3 và EXL3 Đạt Tốc Độ Thử Nghiệm Ấn Tượng Cho Mô Hình Flash Next

Một người dùng AI cục bộ đã chia sẻ kết quả thử nghiệm cho thấy hiệu năng vượt trội của ExllamaV3 và định dạng lượng hóa EXL3 trên mô hình Qwen3.8-Flash-Next. Hệ thống sử dụng 3 card đồ họa RTX 3090 đạt tốc độ nạp ngữ cảnh (prefill) 1.500 token/giây và tốc độ sinh từ (decode) 80 token/giây ở độ dài ngữ cảnh lên tới 262k. Các kết quả thử nghiệm này cho thấy ExllamaV3 có thể vượt trội đáng kể so với các công cụ suy luận phổ biến như llama.cpp và vLLM khi chạy mô hình đa thức ngữ cảnh dài trên phần cứng người dùng cá nhân. Điều này thể hiện sự tiến bộ nhanh chóng của các kỹ thuật lượng hóa mã nguồn mở, giúp người dùng vận hành hiệu quả các mô hình lớn trên GPU phổ thông. Thử nghiệm với bản lượng hóa EXL3 3-bit mỗi trọng số (3bpw) bao gồm cả xử lý hình ảnh (vision) và giải mã suy đoán (speculative decoding) ở độ dài ngữ cảnh 262k token. Cấu hình sử dụng 1 card RTX 5090 đạt cùng tốc độ prefill 1.500 token/giây nhưng có tốc độ decode chậm hơn (29 token/giây) so với hệ thống chạy 3 card RTX 3090.

## KIẾN THỨC NỀN

ExllamaV3 là một thư viện suy luận mã nguồn mở được tối ưu hóa đặc biệt để chạy các mô hình ngôn ngữ lớn cục bộ trên GPU Nvidia cá nhân thông qua các định dạng lượng hóa tiên tiến như EXL3. Qwen3.8-Flash-Next là mô hình đa phương thức dạng Mixture-of-Experts (MoE) do Alibaba Qwen phát hành dưới dạng bản xem trước cho kiến trúc thế hệ tiếp theo của họ.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM Inference#ExLlama#Local AI#GPU Benchmarks#Hardware

$ subscribe --daily