Đánh giá hiệu năng mô hình Ternary-Bonsai-2-27B so với các bản nén 2-bit
Một thành viên cộng đồng LocalLLaMA đã tiến hành đánh giá hiệu năng mô hình 27 tỷ tham số Ternary-Bonsai-2-27B-PQ2_0 so với các mô hình nén siêu thấp cùng dung lượng như Qwen3.8-27B IQ2_XXS. Thông qua các bộ kiểm thử tự phát triển gồm tìm kiếm chìa khóa nhiều bước trong nhiễu, tái tạo cụm từ và ghi nhớ đoạn văn dài, bài kiểm tra đánh giá mức độ duy trì khả năng truy xuất và suy luận sau nén cực hạn. Các kỹ thuật nén tham số cực hạn cho phép chạy các mô hình nguồn mở kích thước lớn ngay trên thiết bị cá nhân có dung lượng VRAM hạn chế. Những bài kiểm thử thực tế này giúp cộng đồng xác định liệu kiến trúc nén 3 giá trị (ternary) có vượt trội hơn các phương pháp lượng tử hóa 2-bit truyền thống khi bộ nhớ bị giới hạn nghiêm trọng. Bài thử nghiệm chỉ ra rằng việc mở rộng cửa sổ ngữ cảnh làm suy giảm nghiêm trọng khả năng truy xuất thông tin của các mô hình, cho thấy dung lượng ngữ cảnh lớn ít có giá trị nếu cơ chế chú ý bị suy yếu ở khoảng cách xa. Tác giả cũng thay thế bài kiểm tra kim tìm trong đáy bể thông thường bằng thử nghiệm tìm khóa nhiều bước kèm thông tin nhiễu để tránh việc các mô hình dễ dàng đạt điểm tối đa.
## KIẾN THỨC NỀN
Lượng tử hóa 3 giá trị (Ternary quantization) giới hạn trọng số mô hình vào ba giá trị rời rạc (thường là -1, 0 và +1), hay còn gọi là các mô hình 1.58-bit nhằm giảm mạnh yêu cầu băng thông bộ nhớ và tính toán. Ngược lại, các định dạng lượng tử hóa theo ma trận độ quan trọng như IQ2_XXS thực hiện nén mô hình sau huấn luyện xuống khoảng 2 bit cho mỗi trọng số bằng các kỹ thuật tái thiết ma trận để giữ lại độ chính xác.