PrismML Ra Mắt Bonsai 2 27B Lượng Hóa Tam Phân Chỉ Tốn 5,9GB Bộ Nhớ
PrismML vừa ra mắt Bonsai 2 27B, mô hình ngôn ngữ lượng hóa tam phân dựa trên Qwen3.8 27B giúp cắt giảm bộ nhớ xuống còn 5,9GB (chưa bằng 1/9 ban đầu) nhưng vẫn giữ được 98,2% hiệu năng của mô hình gốc. Mô hình này được phát hành mã nguồn mở theo giấy phép Apache 2.0 và hỗ trợ cửa sổ ngữ cảnh 262K token. Phát hành này chứng minh rằng kỹ thuật lượng hóa tam phân tiên tiến có thể đưa mô hình 27B tham số chạy trực tiếp trên phần ứng cá nhân phục vụ các tác vụ như lập trình hay phân tích tài liệu mà không phụ thuộc vào API đám mây. Bên cạnh đó, mô hình còn đạt hiệu suất năng lượng vượt trội, tiêu thụ ít điện năng trên mỗi token hơn cả các mô hình 8B thông thường. Bonsai 2 27B sử dụng kỹ thuật tỷ lệ theo nhóm FP16 để đạt tỷ lệ hiệu dụng 1,76 bit/trọng số, đạt tốc độ xử lý 143 token/giây trên NVIDIA RTX 5090 và 46,8 token/giây trên Apple Silicon M5 Max qua framework MLX. Trên card RTX 4090, hiệu suất năng lượng của mô hình đạt 0,714 mWh/token, thấp hơn 40% so với mô hình 8B độ chính xác đầy đủ.
## KIẾN THỨC NỀN
Lượng hóa mô hình (quantization) là kỹ thuật nén mô hình ngôn ngữ lớn bằng cách chuyển đổi các trọng số số thực độ chính xác cao sang định dạng bit thấp hơn nhằm giảm nhu cầu bộ nhớ và tính toán. Lượng hóa tam phân (ternary quantization) giới hạn các trọng số mô hình chỉ còn ba giá trị rời rạc (thường là -1, 0 và +1), giúp giảm tối đa bộ nhớ cần thiết mà vẫn cố gắng giữ nguyên độ chính xác.