Thử nghiệm so sánh hiệu năng giữa Qwen3.8 27B IQ3_XXS và Bonsai Ternary
Một người dùng đã đo kiểm hiệu năng mô hình Qwen3.8 27B định lượng bằng IQ3_XXS (10,18 GiB) so với Bonsai Ternary PQ2 (6,42 GiB) trên phần cứng cá nhân có 16 GB VRAM qua các tác vụ tạo giao diện. Kết quả cho thấy mặc dù Bonsai tiết kiệm bộ nhớ hơn, thời gian hoàn thành tác vụ của nó lại chậm hơn gấp 3 lần và sinh ra số lượng token đầu ra nhiều gấp 3,10 lần. Thử nghiệm thực tế này chỉ ra rằng các phương pháp nén cực hạn như định lượng tam phân có thể làm giảm độ súc tích và tốc độ thực thi, làm mất đi lợi thế tiết kiệm VRAM. Điều này cho thấy dung lượng tệp nhỏ hơn không đồng nghĩa với việc tăng tốc độ hay hiệu quả thực tế khi chạy mô hình cục bộ. Qwen IQ3_XXS hoàn thành chuỗi thử nghiệm trong 8:00 phút với 27.197 token đầu ra, so với 24:09 phút và 84.176 token của Bonsai PQ2. Ngoài ra, IQ3 tận dụng được kỹ thuật Dự đoán Đa Token (MTP) trong llama.cpp với tỷ lệ chấp nhận 39,76%, một tính năng tối ưu mà Bonsai hiện chưa hỗ trợ.
## KIẾN THỨC NỀN
Định lượng LLM giúp giảm độ chính xác của trọng số mô hình để tiết kiệm bộ nhớ, trong đó IQ3_XXS của llama.cpp sử dụng kỹ thuật nén 3-bit nâng cao. Định lượng tam phân (ternary quantization) giới hạn trọng số chỉ còn ba giá trị (thường là -1, 0, 1 hoặc ~1,58 bit), đạt mức nén rất cao nhưng đánh đổi bằng độ chính xác. Dự đoán Đa Token (MTP) là kỹ thuật tăng tốc suy luận cho phép mô hình dự đoán đồng thời nhiều token tiếp theo thay vì từng token một.