Chạy mô hình 35B trên laptop CPU cấu hình thấp để tạo trò chơi
Một người dùng đã thử nghiệm chạy mô hình 35 tỷ tham số (Qwen3.6 35B được lượng hóa 2-bit IQ2_XXS) trên chiếc laptop chip Intel i3 giá rẻ với 8GB RAM và không có VRAM rời. Cấu hình này đã tạo ra thành công một trò chơi nhập vai 2D dạng tệp HTML/JS đơn trong 24 phút với tốc độ 2 token/giây thông qua llama.cpp. Thử nghiệm này cho thấy kỹ thuật lượng hóa mô hình cực thấp cho phép thực hiện các tác vụ AI phức tạp trên phần cứng phổ thông mà không cần GPU đắt tiền. Điều này giúp việc chạy cục bộ các mô hình ngôn ngữ lớn trở nên dễ tiếp cận hơn đối với các nhà phát triển và người dùng cá nhân có ngân sách hạn chế. Mô hình được chạy bằng llama-server hoàn toàn trên CPU (`-ngl 0`), sử dụng bộ nhớ đệm KV 8-bit và độ dài ngữ cảnh 8.192 token. Việc tắt chế độ suy luận giúp mô hình tránh lãng phí thời gian tính toán cho các token suy nghĩ trung gian, đảm bảo tốc độ tạo kết quả ổn định trên CPU.
## KIẾN THỨC NỀN
IQ2_XXS là kỹ thuật lượng hóa 2-bit cực thấp được thiết kế để nén các mô hình lớn vừa vặn với bộ nhớ hạn chế mà vẫn giữ được khả năng xử lý cốt lõi. GGUF là định dạng mô hình nhị phân đơn tệp được thiết kế để tối ưu hóa nạp bộ nhớ và suy luận trên CPU trong hệ sinh thái llama.cpp.