Chạy mô hình DeepSeek lớn cục bộ với RTX 5090 và AMD Epyc
Một người dùng đã chạy thành công mô hình DeepSeek lớn sử dụng trọng số khoảng 151GB ở định dạng lượng tử hóa UD-Q8_K_XL trên cấu hình lai cục bộ gồm CPU AMD Epyc 7663, 256GB RAM DDR4 và một GPU RTX 5090 duy nhất. Hệ thống này đạt tốc độ suy luận từ 23,8 đến 24,6 token mỗi giây với độ dài ngữ cảnh từ 100k-128k. Thử nghiệm này chứng minh rằng các mô hình Hỗn hợp chuyên gia (MoE) khổng lồ có thể chạy cục bộ với tốc độ khả dụng mà không cần đến các cụm đa GPU cấp doanh nghiệp trị giá hàng chục nghìn đô la. Nó làm nổi bật tính khả thi của việc chuyển tải tính toán MoE sang CPU kết hợp với GPU tiêu dùng thế hệ tiếp theo như RTX 5090. Người dùng lưu ý rằng hiệu suất bị giảm khi sử dụng DFlash (một khung giải mã suy đoán) hoặc khi thay thế RTX 5090 bằng RTX 3090 cũ hơn. Hệ thống đã sử dụng định dạng lượng tử hóa UD-Q8_K_XL của Unsloth để khớp kích thước mô hình vào tổng dung lượng VRAM và RAM của hệ thống.
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ lớn, đặc biệt là các kiến trúc Hỗn hợp chuyên gia (MoE) như DeepSeek, đòi hỏi lượng bộ nhớ khổng lồ để lưu trữ trọng số mô hình. Việc chuyển tải tính toán MoE sang CPU (CPU-MoE) cho phép chạy các phần của mô hình trên RAM hệ thống và CPU, giúp tiết kiệm chi phí hơn nhưng chậm hơn so với VRAM của GPU. Các kỹ thuật lượng tử hóa như định dạng UD của Unsloth giúp nén trọng số mô hình để giảm yêu cầu bộ nhớ, trong khi các công cụ giải mã suy đoán như DFlash nhằm tăng tốc độ tạo token bằng cách dự đoán trước các token nháp.