Qualcomm và PrismML chạy mô hình VLM 1-bit Bonsai ngoại tuyến trên kính thông minh
Qualcomm và PrismML đã triển khai thành công mô hình thị giác - ngôn ngữ (VLM) Bonsai 2 tỷ tham số nén 1-bit chạy cục bộ trên nền tảng kính thông minh Snapdragon AR1 Gen 1. Kiến trúc này giúp giảm dung lượng bộ nhớ xuống còn 1/4 so me với mô hình 4-bit tiêu chuẩn, đồng thời tăng gấp đôi tốc độ tạo token văn bản. Việc cho phép AI đa thức chạy hoàn toàn trên thiết bị sẽ loại bỏ sự phụ thuộc vào kết nối đám mây, giúp kính thông minh thực hiện nhận diện hình ảnh, dịch thuật và tương tác giọng nói thời gian thực một cách ngoại tuyến. Bước tiến này giúp giảm đáng kể độ trễ, hạ nhiệt độ thiết bị và kéo dài thời lượng pin cho phần cứng đeo siêu nhẹ. Mô hình Bonsai 1-bit nén trọng số mô hình xuống độ chính xác cực thấp, cho phép phần cứng chứa số lượng tham số nhiều hơn khoảng 4 lần trong cùng một dung lượng bộ nhớ. Bằng cách giảm thiểu nhu cầu băng thông bộ nhớ trong quá trình suy luận, hệ thống cải thiện hiệu suất năng lượng và mang lại trải nghiệm đeo thoải mái hơn trên các thiết bị AR nhỏ gọn.
## KIẾN THỨC NỀN
Lượng hóa mô hình (Model Quantization) là kỹ thuật nén giảm độ chính xác bit của các trọng số mô hình (ví dụ từ số thực 16-bit xuống số nguyên 4-bit hoặc 1-bit) nhằm thu nhỏ dung lượng lưu trữ và tăng tốc độ tính toán. Mô hình thị giác - ngôn ngữ (VLM) kết hợp khả năng nhận diện hình ảnh với tạo văn bản, nhưng yêu cầu tài nguyên cao của chúng trước đây đã buộc kính thông minh phải truyền dữ liệu hình ảnh và văn bản lên máy chủ đám mây để xử lý.