Người dùng AI cục bộ mong muốn phiên bản Qwen 3.8 35B MoE nhanh hơn cho Apple Silicon
Một cuộc thảo luận trên Reddit nêu bật yêu cầu của người dùng về phiên bản Qwen 3.8 35B với 3 tỷ tham số hoạt động (A3B) nhằm cân bằng giữa tốc độ và trí thông minh trên phần cứng tiêu dùng như Apple M1 Max. Người dùng lưu ý rằng mô hình Qwen 3.8 27B hiện tại quá chậm để sử dụng thực tế trên thiết bị cục bộ do thời gian suy nghĩ kéo dài. Điều này làm nổi bật thách thức liên tục đối với người dùng LLM cục bộ khi phải cân bằng giữa trí thông minh của mô hình (thường được mở rộng qua tính toán thời gian kiểm thử) và giới hạn phần cứng. Nó nhấn mạnh nhu cầu về kiến trúc Mixture-of-Experts (MoE) giúp giảm lượng tham số hoạt động để chạy các mô hình tiên tiến trên phần cứng tiêu dùng. Người dùng đề xuất mô hình "35B A3B", ám chỉ cấu hình Mixture of Experts (MoE) với tổng số 35 tỷ tham số nhưng chỉ có 3 tỷ tham số hoạt động trên mỗi token, giúp tăng tốc độ suy luận đáng kể. Việc chạy các mô hình lập luận cục bộ trên Apple Silicon (như M1 Max) mà không có phần cứng GPU chuyên dụng như card Nvidia RTX thường dẫn đến thời gian tạo phản hồi không thực tế.
## KIẾN THỨC NỀN
Mixture of Experts (MoE) là một kiến trúc LLM chỉ sử dụng một tập hợp con trong tổng số tham số (tham số hoạt động) cho mỗi token, cho phép các mô hình lớn hơn chạy nhanh hơn. Tính toán thời gian kiểm thử (test-time compute) cho phép các mô hình lập luận tạo ra chuỗi suy nghĩ nội bộ để giải quyết các tác vụ phức tạp, giúp tăng độ chính xác nhưng lại làm giảm đáng kể tốc độ tạo phản hồi.