PrismML phát hành mô hình ngôn ngữ Ternary Bonsai 2 27B dạng 1,58-bit
PrismML đã phát hành Ternary Bonsai 2 27B, một mô hình ngôn ngữ mã nguồn mở 27 tỷ tham số hoạt động với kỹ thuật nén lượng tử hóa tam phân 1,58-bit trên toàn bộ kiến trúc. Các tệp mô hình GGUF đã có mặt trên Hugging Face để chạy trên thiết bị cá nhân và các công cụ suy luận như vLLM và LM Studio. Phát hành này đánh dấu một bước tiến quan trọng trong công nghệ nén mô hình LLM cực hạn, cho phép một mô hình 27 tỷ tham số vừa vặn trong dung lượng bộ nhớ nhỏ hơn đáng kể. Bằng cách giảm mạnh yêu cầu băng thông bộ nhớ, các mô hình 1,58-bit giúp việc chạy các mô hình AI lớn trên máy cục bộ trở nên dễ tiếp cận và tiết kiệm năng lượng hơn. Khác với các phương pháp nén lượng tử hóa kết hợp sau huấn luyện, Ternary Bonsai áp dụng biểu diễn trọng số 1,58-bit hoàn chỉnh trên toàn bộ mạng mô hình mà không dựa vào các lớp trọng số độ chính xác cao hơn dự phòng. Các tệp GGUF cho phép triển khai dễ dàng trên nhiều nền tảng như vLLM, Docker và LM Studio.
## KIẾN THỨC NỀN
Lượng tử hóa tam phân (hay 1,58-bit) giới hạn các trọng số của mạng thần kinh vào ba giá trị: {-1, 0, +1}. Vì log2(3) xấp xỉ 1,58, mỗi trọng số chỉ yêu cầu 1,58 bit lưu trữ thay vì giá trị dấu phẩy động 16-bit (FP16) tiêu chuẩn. Kiểu mã hóa này cho phép thay thế các phép nhân ma trận phức tạp bằng các phép cộng và trừ đơn giản, giảm đáng kể chi phí tính toán và bộ nhớ phần cứng.