Thử nghiệm hiệu năng 21 biến thể định lượng Qwen3.8 27B trên 16GB VRAM
Một nhà phát triển đã thử nghiệm 21 biến thể định lượng (quantization) khác nhau của mô hình Qwen3.8 27B trên GPU RTX 5080 16GB VRAM bằng các câu lệnh lập trình C. Bài thử nghiệm đánh giá mức độ suy giảm chất lượng từ định lượng 2-bit đến 4-bit thông qua thước đo độ phân kỳ Kullback-Leibler (KLD) và tỷ lệ khớp token top-p. Chạy các mô hình lớn 27 tỷ tham số trên GPU tiêu dùng với 16GB VRAM đòi hỏi phải định lượng sâu, do đó việc đo lường chất lượng thực tế là rất quan trọng. Dữ liệu thực nghiệm này giúp người dùng chọn đúng bản định lượng tối ưu mà không bị quá tải bộ nhớ hay mất đi độ chính xác không cần thiết. Biến thể IQ4_XS từ `bartowski` là lựa chọn toàn diện nhất cho VRAM 16GB, chiếm 14,5 GiB bộ nhớ với chỉ số KLD trung bình thấp (0,056) và tỷ lệ khớp top-p đạt 95,8%. Các tùy chọn chất lượng cao hơn như Q4_K_XL có KLD thấp hơn (0,028) nhưng vượt quá hạn ngạch 16GB khi ngốn khoảng 16,5 GiB, trong khi các bản 2-bit bị suy giảm chất lượng rất nghiêm trọng.
## KIẾN THỨC NỀN
Định lượng LLM (quantization) là nén các trọng số của mô hình xuống độ chính xác bit thấp hơn (như số nguyên 4-bit) nhằm giảm dung lượng VRAM yêu cầu. Độ phân kỳ Kullback-Leibler (KLD) đo lường mức độ sai lệch phân phối xác suất đầu ra của mô hình định lượng so với mô hình gốc chưa nén. Ngoài ra, abliteration là kỹ thuật hậu huấn luyện giúp vô hiệu hóa các vectơ kích hoạt từ chối an toàn để tạo ra phiên bản không bị kiểm duyệt (uncensored) mà không cần huấn luyện lại.