~/LLM/ternary-bonsai-2-a-27b-llm-compressed-under-6gb-for-in-browser

Ternary Bonsai 2: Mô hình LLM 27B nén dưới 6GB chạy trên trình duyệt qua WebGPU

Prism ML vừa phát hành Ternary Bonsai 2, một mô hình ngôn ngữ 27 tỷ tham số được phát triển từ Qwen3.8-27B sử dụng phương pháp lượng thể hóa trọng số tam phân. Kỹ thuật này giúp giảm dung lượng mô hình xuống dưới 6GB—nhỏ hơn 9 lần so với độ chính xác FP16—cho phép mô hình chạy trực tiếp trên trình duyệt qua WebGPU mà vẫn giữ được 98.2% độ chính xác ban đầu. Khả năng vận hành mô hình 27 tỷ tham số trực tiếp trên trình duyệt web mà không cần API đám mây hay máy chủ GPU chuyên dụng là một bước tiến lớn cho trí tuệ nhân tạo trên thiết bị cuối và quyền riêng tư dữ liệu. Điều này cho thấy kỹ thuật lượng thể hóa chuyên sâu có thể đưa các mô hình mã nguồn mở cỡ lớn đến với thiết bị người dùng phổ thông. Ternary Bonsai 2 giữ nguyên toàn bộ kiến trúc nhân quả chú ý hỗn hợp (hybrid-attention causal architecture) của Qwen3.8-27B. Bộ sưu tập mô hình cùng không gian thử nghiệm WebGPU tương tác hiện đã khả dụng trên Hugging Face.

## KIẾN THỨC NỀN

Lượng thể hóa mô hình (Quantization) giúp giảm dung lượng bộ nhớ và yêu cầu tính toán bằng cách biểu diễn trọng số mạng nơ-ron ở định dạng độ chính xác thấp hơn, tiêu biểu như trọng số tam phân (ternary weights) chỉ giới hạn ở ba giá trị (-1, 0, +1). WebGPU là chuẩn web hiện đại cho phép các ứng dụng trình duyệt khai thác trực tiếp khả năng tăng tốc của GPU phần cứng. Kết hợp hai công nghệ này cho phép các mô hình ngôn ngữ phức tạp thực thi trực tiếp phía máy khách trong trình duyệt.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM#Quantization#WebGPU#Model Compression#Local AI

$ subscribe --daily

Ternary Bonsai 2: Mô hình LLM 27B nén dưới 6GB chạy trên trình duyệt qua WebGPU | Daily News