~/LOCAL AI/running-qwen3-8-flash-at-15-tokens-s-on-12gb-vram-via

Chạy Qwen3.8 Flash đạt 15 Token/s trên GPU 12GB VRAM nhờ Offload

Một người dùng đã chạy thành công mô hình Qwen3.8 Flash lượng tử hóa sâu (IQ3_XXS mức ~3 bpw) trên phần cứng phổ thông với card đồ họa RTX 5070 SFF 12GB VRAM. Nhờ cơ chế offload dữ liệu qua 12GB VRAM, 64GB DDR5 RAM và ổ cứng NVMe SSD, hệ thống đạt tốc độ sinh văn bản ổn định khoảng 14–15 token/giây với độ dài ngữ cảnh tối đa lên tới 128K. Kết quả thử nghiệm này cho thấy các kỹ thuật lượng tử hóa hiện đại kết hợp với offload bộ nhớ hỗn hợp giúp GPU phổ thông tầm trung vẫn chạy được các LLM mã nguồn mở kích thước lớn tại địa phương. Điều này làm giảm đáng kể rào cản phần cứng để trải nghiệm các mô hình AI tiên tiến với cửa sổ ngữ cảnh rộng mà không cần đến GPU doanh nghiệp đắt đỏ. Tổng kích thước mô hình định dạng GGUF là khoảng 76GB, trong đó 47GB được phân tách nạp vào VRAM và RAM hệ thống, phần còn lại được nạp trực tiếp từ ổ cứng NVMe SSD. Tốc độ xử lý prompt đạt 104,7 token/giây ở ngữ cảnh 20K, và chất lượng đầu ra được báo cáo tương đương với mức lượng tử hóa Q6–Q8 dù chỉ sử dụng 3 bit cho mỗi trọng số (IQ3_XXS).

## KIẾN THỨC NỀN

Việc chạy các mô hình ngôn ngữ lớn tại địa phương thường đòi hỏi dung lượng VRAM rất cao, khiến phần cứng cá nhân trở thành nút thắt đối với các mô hình có số lượng tham số lớn. Lượng tử hóa mô hình giúp giảm độ chính xác (như nén trọng số số thực xuống các định dạng 3-bit) để tiết kiệm dung lượng, trong khi cơ chế offload bộ nhớ sẽ chia nhỏ việc thực thi mô hình giữa VRAM của GPU, RAM hệ thống và ổ cứng SSD tốc độ cao.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Local AI#LLM Quantization#Hardware Benchmarks#Model Offloading#GGUF

$ subscribe --daily

Chạy Qwen3.8 Flash đạt 15 Token/s trên GPU 12GB VRAM nhờ Offload | Daily News