~/WEBGPU/1-bit-27b-llm-runs-in-browser-via-webgpu-at-30-tokens

LLM 27B 1-bit chạy trực tiếp trên trình duyệt qua WebGPU đạt 30 token/giây

Một nhà phát triển đã xây dựng công cụ suy luận WebGPU/WGSL tùy chỉnh mang tên mentria.ai, cho phép chạy mô hình nén 1-bit 27 tỷ tham số (Bonsai-27B) của Prism ML hoàn toàn trong trình duyệt web mà không cần cài đặt hay máy chủ. Công cụ này đạt tốc độ giải mã 25–30 token/giây trên GPU RTX 3060 Laptop bằng cách nén toàn bộ 27 tỷ tham số chỉ còn 3,8 GB VRAM. Thành tựu này chứng minh các mô hình ngôn ngữ lớn tầm 27B có thể chạy riêng tư và cục bộ trên laptop phổ thông trực tiếp từ trình duyệt web tiêu chuẩn. Nó loại bỏ chi phí máy chủ và lo ngại về độ trễ, đồng thời giữ dữ liệu người dùng hoàn toàn trên thiết bị, thúc đẩy tiềm năng ứng dụng AI biên trên trình duyệt. Công cụ này lưu trữ trọng số mô hình ở mức ~1,14 bit cho mỗi tham số và thay thế các phép nhân ma trận chuẩn bằng bảng tra cứu tính sẵn trong bộ nhớ đệm GPU. Các tối ưu hóa như xử lý hiện tượng xung đột bank bộ nhớ dùng chung trên kiến trúc GPU Ampere và bố trí lại tile prompt đã giúp tăng gấp đôi tốc độ giải mã từ 15 lên hơn 30 token/giây.

## KIẾN THỨC NỀN

WebGPU là API web hiện đại cho phép tính toán song song hiệu suất cao trên GPU ngay trong trình duyệt nhờ ngôn ngữ shader WGSL. Kỹ thuật lượng hóa (quantization) làm giảm độ chính xác số học của trọng số LLM, chẳng hạn như chuyển từ số thực 16-bit sang 1-bit, giúp giảm đáng kể nhu cầu VRAM. Các kiến trúc bit cực thấp này cho phép các mô hình hàng chục tỷ tham số nằm vừa vặn trong dung lượng VRAM hạn chế của laptop và điện thoại thông minh phổ thông.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#WebGPU#LLM Inference#Quantization#Local LLM#Edge AI

$ subscribe --daily

LLM 27B 1-bit chạy trực tiếp trên trình duyệt qua WebGPU đạt 30 token/giây | Daily News