Chạy cục bộ Qwen 3.8 Flash Next trên điện thoại Android 12GB RAM
Một nhà phát triển đã chạy thành công mô hình Qwen 3.8 Flash Next (dung lượng gốc 80GB) cục bộ trên một chiếc điện thoại Android tầm trung có 12GB RAM. Mô hình đạt tốc độ xử lý 3,5 token mỗi giây nhờ vào các tối ưu hóa tùy chỉnh và kỹ thuật lượng tử hóa thấp trên các phần dày đặc (dense parts). Thành tựu này chứng minh rằng các mô hình ngôn ngữ lớn (LLM) khổng lồ có thể chạy trực tiếp trên phần cứng di động phổ thông mà không cần phụ thuộc vào máy chủ đám mây. Điều này mở ra những khả năng mới cho các ứng dụng tính toán biên (edge computing) riêng tư, ngoại tuyến và tiết kiệm chi phí ngay trên điện thoại thông minh hàng ngày. Hệ thống này chạy trên một chiếc điện thoại tầm trung giá khoảng 400–500 USD bằng cách sử dụng lượng tử hóa mạnh mẽ trên các phần dày đặc của mô hình để nén dung lượng 80GB vừa vặn vào 12GB RAM. Nhà phát triển đã đạt được tốc độ khả dụng là 3,5 token mỗi giây, cho thấy tính khả thi của việc thực thi LLM trên thiết bị di động.
## KIẾN THỨC NỀN
Qwen là một họ các mô hình ngôn ngữ lớn được phát triển bởi Alibaba Cloud. Lượng tử hóa (quantization) là một kỹ thuật nén mô hình giúp giảm độ chính xác của các trọng số, giúp giảm đáng kể yêu cầu bộ nhớ và cho phép các mô hình lớn chạy trên phần cứng bị giới hạn tài nguyên như thiết bị di động.