~/AI ML/qwen3-8-flash-next-a-preview-of-the-qwen4-multimodal-moe-architecture

Qwen3.8-Flash-Next: Bản xem trước của kiến trúc MoE đa phương thức Qwen4

Qwen đã phát hành Qwen3.8-Flash-Next, một mô hình mã nguồn mở đa phương thức Mixture of Experts (MoE) mới với 125 tỷ tham số, đóng vai trò là bản xem trước sớm cho kiến trúc Qwen4 sắp tới. Mô hình này chỉ sử dụng 6 tỷ tham số hoạt động cho mỗi token, giúp mang lại hiệu suất suy luận tăng trưởng đáng kể. Bản phát hành này giúp các nhà phát triển và nghiên cứu tiếp cận sớm kiến trúc Qwen4 thế hệ tiếp theo dưới dạng mã nguồn mở. Bằng cách tận dụng thiết kế MoE thưa thớt, mô hình mang lại khả năng đa phương thức dung lượng lớn nhưng vẫn đủ hiệu quả về mặt tính toán để chạy trên các phần cứng dễ tiếp cận. Những người thử nghiệm sớm đã chạy thành công các phiên bản GGUF lượng tử hóa của mô hình, chẳng hạn như các biến thể UD-IQ1_S 72,5GB và UD-Q2_K_XL 78,9GB, trên phần cứng như NVIDIA DGX Spark. Các phiên bản lượng tử hóa này, do Unsloth cung cấp, cho phép chạy mô hình 125B khổng lồ cục bộ với yêu cầu bộ nhớ giảm đáng kể.

## KIẾN THỨC NỀN

Mixture of Experts (MoE) là một kiến trúc AI định tuyến các đầu vào đến các mạng con chuyên biệt gọi là "chuyên gia", chỉ kích hoạt một phần nhỏ trong tổng số tham số để tiết kiệm tài nguyên tính toán. GGUF là định dạng tệp nhị phân được tối ưu hóa để tải và lưu mô hình nhanh chóng, giúp suy luận cục bộ hiệu quả hơn. Unsloth cung cấp các công cụ và nền tảng tối ưu hóa để chạy và huấn luyện các mô hình mở này trên phần cứng cục bộ.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI/ML#LLMs#Open Source#Qwen

$ subscribe --daily

Qwen3.8-Flash-Next: Bản xem trước của kiến trúc MoE đa phương thức Qwen4 | Daily News