Chạy mô hình thị giác Qwen 3.6 35B với 131K context trên GPU 6GB VRAM
Một người dùng LLM cục bộ đã trình diễn cách chạy mô hình thị giác đa thức Qwen 3.6 35B A3B với cửa sổ ngữ cảnh 131K trên GPU RTX 2060 6GB bằng llama.cpp. Bằng cách đẩy (offload) 39 chuyên gia MoE và bộ chiếu thị giác (vision projector) sang RAM hệ thống, cấu hình này đạt tốc độ giải mã 15–23 token/giây trong khi giữ mức sử dụng VRAM dưới 5,2 GB. Thử nghiệm thực tế này chứng minh rằng các mô hình thị giác Mixture-of-Experts (MoE) lớn cỡ 35 tỷ tham số vẫn có thể chạy cục bộ trên phần cứng bình dân. Nó cho thấy các kỹ thuật offload chuyên gia và bộ chiếu giúp phổ cập hóa AI đa thức với cửa sổ ngữ cảnh dài mà không cần đến GPU doanh nghiệp đắt tiền. Cấu hình này sử dụng mô hình định lượng Q4_K_M kết hợp với bộ đệm KV Q8_0 trên máy tính trang bị RTX 2060 6GB, 32GB RAM DDR4 và CPU Intel i5-10400F. Việc chạy bộ chiếu thị giác trên CPU (`--no-mmproj-offload`) tiết kiệm khoảng 1GB VRAM để tránh lỗi hết bộ nhớ (OOM), trong khi tốc độ nạp ngữ cảnh (prefill) duy trì khoảng 485 token/giây ngay cả khi độ dài ngữ cảnh đạt 90K.
## KIẾN THỨC NỀN
Kiến trúc Mixture-of-Experts (MoE) chia trọng số mô hình thành các mạng con chuyên biệt ('chuyên gia') và định tuyến dữ liệu linh hoạt, cho phép đẩy (offload) các tầng chuyên gia không dùng đến sang RAM hệ thống thay vì lưu trên VRAM. Các công cụ như llama.cpp tận dụng kỹ thuật định lượng mô hình (như Q4_K_M) và nén bộ đệm KV để giảm đáng kể mức tiêu thụ VRAM trong quá trình xử lý ngữ cảnh dài.