~/LOCAL LLMS/running-deepseek-v4-flash-284b-moe-on-budget-quad-xeon-and-dual

Chạy DeepSeek V4-Flash 284B MoE trên cấu hình giá rẻ Quad-Xeon và Dual RTX 3090

Một nhà phát triển đã chạy thành công mô hình DeepSeek V4-Flash-0731 chính thức nặng 156 GB trên cấu hình giá rẻ gồm máy chủ Dell PowerEdge R940 quad-Xeon cũ và hai GPU RTX 3090. Cấu hình này đạt tốc độ 33 token/giây cho một người dùng và băng thông tổng hợp lên tới 68 token/giây. Thử nghiệm này chứng minh rằng các mô hình Mixture of Experts (MoE) khổng lồ có thể chạy cục bộ trên phần cứng doanh nghiệp cũ và phần cứng tiêu dùng giá rẻ thay vì các máy trạm hiện đại đắt đỏ. Nó cung cấp một giải pháp thực tế cho các nhà phát triển muốn triển khai các mô hình lớn mà không cần đầu tư vào phần cứng AI cao cấp và khan hiếm. Cấu hình này sử dụng một bản phân nhánh vLLM đặc biệt với công cụ MoE lai CPU-GPU để thực hiện tính toán chuyên gia nhận biết NUMA trong RAM hệ thống, đồng thời định tuyến tính toán qua các nhân Marlin để chạy trọng số MXFP4/FP8 trên GPU Ampere. Kỹ thuật giải mã suy đoán (DSpark) được tích hợp sẵn giúp tăng tốc độ lên 2,6 lần so với các triển khai lai tiêu chuẩn.

## KIẾN THỨC NỀN

Mixture of Experts (MoE) là một kiến trúc mạng thần kinh chỉ kích hoạt một phần nhỏ trong tổng số tham số (các chuyên gia) cho mỗi token, cho phép đạt dung lượng lớn với chi phí tính toán thấp hơn. Định lượng (Quantization) là kỹ thuật nén mô hình giúp chuyển đổi các trọng số sang định dạng độ chính xác thấp hơn như FP8 hoặc MXFP4 để giảm dung lượng bộ nhớ. Trong các máy chủ nhiều socket, kiến trúc NUMA (Non-Uniform Memory Access) phân chia bộ nhớ để các bộ vi xử lý có thể truy cập bộ nhớ cục bộ nhanh hơn bộ nhớ ngoài.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Local LLMs#Hardware Configuration#DeepSeek#Mixture of Experts (MoE)#AI Benchmarks

$ subscribe --daily

Chạy DeepSeek V4-Flash 284B MoE trên cấu hình giá rẻ Quad-Xeon và Dual RTX 3090 | Daily News