~/LLM INFERENC/running-176b-qwen-moe-model-on-a-16gb-vram-laptop-with-tensorsharp

Chạy mô hình Qwen MoE 176B trên laptop VRAM 16GB với TensorSharp

Nhà phát triển fuzhongkai đã trình diễn khả năng chạy mô hình MoE Qwen3.8 Flash Next 176 tỷ tham số trên một chiếc laptop thông thường trang bị GPU RTX 3080 16GB VRAM, 32GB RAM và ổ SSD nhờ công cụ TensorSharp. TensorSharp là một trình suy luận cục bộ mã nguồn mở được thiết kế để điều phối dữ liệu mô hình một cách linh hoạt qua VRAM của GPU, RAM hệ thống và ổ cứng SSD. Thử nghiệm này chứng minh rằng các mô hình Mixture-of-Experts (MoE) khổng lồ có thể chạy hiệu quả trên phần cứng phổ thông mà không cần hệ thống nhiều GPU hay máy trạm đắt tiền với dung lượng RAM lớn. Nó chuyển dịch trọng tâm của việc suy luận LLM cục bộ từ giới hạn bộ nhớ phần cứng sang việc trình thực thi có thể quản lý phân cấp bộ nhớ thông minh đến mức nào. Trong bài kiểm tra hiệu năng so sánh với Strata, TensorSharp đạt tốc độ giải mã 11,09 token/giây so với 10,24 token/giây của Strata, đồng thời rút ngắn đáng kể thời gian thực thi toàn bộ quy trình từ 62,15 giây xuống còn 16,54 giây. Trình suy luận này đạt được kết quả trên nhờ coi SSD như một tầng bộ nhớ tích hợp được điều phối theo sự kích hoạt expert của MoE thay vì chỉ là vùng hoán đổi dữ liệu thông thường.

## KIẾN THỨC NỀN

Mixture of Experts (MoE) là một kiến trúc mô hình ngôn ngữ chia các tham số mạng thành các mạng con gọi là các expert (chuyên gia), và chỉ kích hoạt linh hoạt một tập hợp con nhỏ các tham số cho mỗi token được tạo ra. Mặc dù các mô hình MoE giảm lượng tính toán thực tế trên mỗi token so với mô hình dày (dense), việc lưu trữ toàn bộ tập tham số của chúng trong bộ nhớ thường đòi hỏi dung lượng VRAM hoặc RAM rất lớn.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM Inference#MoE Models#Hardware Optimization#Local AI#Open Source

$ subscribe --daily

Chạy mô hình Qwen MoE 176B trên laptop VRAM 16GB với TensorSharp | Daily News