Cộng đồng đánh giá Ternary Bonsai 2 27B cho các hệ thống LLM cục bộ giới hạn phần cứng
Một người dùng trên r/LocalLLaMA đã xin ý kiến cộng đồng về việc nâng cấp từ Ornith 1.5 9B lên mô hình Ternary Bonsai 2 27B mới phát hành của PrismML. Mô hình 27B này sử dụng kỹ thuật lượng hóa tam phân 1,58-bit dựa trên Qwen3.8 27B để giảm đáng kể yêu cầu bộ nhớ cho việc chạy mô hình cục bộ. Các mô hình tam phân như Bonsai 2 27B giúp mang hiệu suất lớp 27B cận cao cấp đến với người dùng sở hữu GPU phổ thông nhờ giảm dung lượng bộ nhớ trọng số khoảng 9 lần. Điều này cho phép những người dùng có ngân sách hạn chế chạy được các mô hình vốn trước đây chỉ dành cho phần cứng doanh nghiệp đắt tiền. Ternary Bonsai 2 27B giới hạn các trọng số ma trận trong các giá trị {-1, 0, +1} với tỉ lệ nhóm FP16, giữ lại khoảng 98,2% hiệu suất điểm chuẩn của Qwen3.8 27B. Tuy nhiên, các điểm nghẽn bộ nhớ như sự gia tăng KV cache ở độ dài ngữ cảnh lớn vẫn là yếu tố quan trọng cần cân nhắc đối với phần cứng có VRAM thấp.
## KIẾN THỨC NỀN
Lượng hóa 1,58-bit hay lượng hóa tam phân nén các mô hình ngôn ngữ lớn bằng cách giới hạn trọng số mô hình trong ba giá trị, giúp giảm mạnh yêu cầu VRAM trong khi vẫn giữ được độ chính xác suy luận cốt lõi. Trong khi đó, KV cache là kỹ thuật tối ưu hóa giúp tăng tốc quá trình tạo văn bản trong mô hình Transformer bằng cách lưu lại trạng thái của các token trước đó. Tuy nhiên, dung lượng bộ nhớ của KV cache tăng tuyến tính theo độ dài ngữ cảnh, tạo ra rào cản bộ nhớ lớn đối với các hệ thống có GPU ngân sách thấp.