~/LOCAL LLM/running-qwen3-8-flash-next-llm-locally-on-a-smartphone-cpu

Chạy mô hình Qwen3.8-Flash-Next trực tiếp trên CPU điện thoại

Một người dùng Reddit đã trình diễn việc chạy mô hình ngôn ngữ Qwen3.8-Flash-Next hoàn toàn cục bộ trên CPU của điện thoại Xiaomi 14T Pro. Thử nghiệm sử dụng phiên bản mô hình được định lượng IQ3_XXS chạy thông qua ứng dụng di động BigMoeOnEdge. Thử nghiệm này cho thấy sự kết hợp giữa kỹ thuật định lượng bit thấp và các công cụ thực thi edge AI cho phép chạy mô hình AI lớn trên thiết bị di động mà không cần kết nối đám mây. Điều này mở ra triển vọng cho các trợ lý AI riêng tư, hoạt động ngoại tuyến trên thiết bị cá nhân. Thử nghiệm sử dụng định lượng GGUF dạng `IQ3_XXS` cực thấp nhằm nén tối đa dung lượng RAM của mô hình dù có chấp nhận suy giảm một phần chất lượng đầu ra. Trình chạy BigMoeOnEdge là công cụ mã nguồn mở được thiết kế riêng để vận hành các mô hình Mixture-of-Experts (MoE) lớn trên thiết bị chỉ dùng CPU với bộ nhớ hạn chế.

## KIẾN THỨC NỀN

Định lượng (Quantization) là kỹ thuật trong học máy giúp giảm độ chính xác của trọng số mô hình, giảm đáng kể dung lượng bộ nhớ để mô hình có thể chạy trên thiết bị nhỏ hơn. BigMoeOnEdge là một ứng dụng mã nguồn mở trên di động và PC được phát triển nhằm vận hành các mô hình Mixture-of-Experts (MoE) lớn vượt quá giới hạn RAM của thiết bị.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Local LLM#Edge Computing#Quantization#Mobile AI#Qwen

$ subscribe --daily

Chạy mô hình Qwen3.8-Flash-Next trực tiếp trên CPU điện thoại | Daily News