Thử nghiệm so sánh mô hình nén cực đại Bonsai 2 27B với Gemma và Qwen
Một bài thử nghiệm cộng đồng đã đánh giá mô hình nén cực đại Bonsai 2 27B (PQ2_0, 7,2 GB) của PrismML so với Gemma 4 12B (Q8_0, 12,7 GB) và Qwen 3.5 9B (Q6_K, 7,5 GB) trên Nvidia RTX 5090 cho tác vụ tạo cảnh 3D voxel. Bonsai 2 vượt trội hơn hẳn về khả năng suy luận không gian và chi tiết khung cảnh dù tiêu tốn hơn 106.000 token đầu ra, trong đó 90% dành cho quá trình suy luận (thinking). Thử nghiệm cho thấy kỹ thuật nén mô hình tam phân (ternary) mức cực thấp có thể đưa năng lực suy luận cấp cao của mô hình 27B vào dung lượng VRAM dưới 8 GB, giúp các tác vụ lập trình tự động và tạo hình 3D phức tạp chạy tốt trên GPU phổ thông như RTX 3060. Điều này đánh dấu bước tiến quan trọng trong việc triển khai các mô hình trí tuệ nhân tạo thông minh, tiết kiệm bộ nhớ cho các hệ thống AI nguồn mở chạy cục bộ. Chạy trên bản fork llama.cpp của PrismML với chiều dài ngữ cảnh 262.144 token, Bonsai 2 đạt tốc độ ~101 token/giây và tạo thành công tệp Three.js dựng chùa Nhật Bản, trong khi Gemma cho kết quả thiếu chi tiết và Qwen bị lỗi hoàn toàn. Một chi tiết kỹ thuật đáng chú ý là định dạng nén GGUF của Bonsai đòi hỏi bản thực thi tùy chỉnh của PrismML thay vì llama.cpp nguyên bản.
## KIẾN THỨC NỀN
Lượng hóa (quantization) là kỹ thuật giảm độ chính xác của trọng số mô hình nhằm hạ thấp dung lượng VRAM cần thiết nhưng vẫn giữ nguyên tối đa độ chính xác. PrismML chuyên phát triển các kỹ thuật lượng hóa 1-bit và tam phân (ternary), cho phép nén các mô hình nền tảng lớn để chạy trên phần cứng giới hạn như máy tính cá nhân hoặc card đồ họa tầm trung.