~/HARDWARE/building-a-3-000-home-server-with-128gb-vram-for-local-llm

Xây dựng máy chủ tại nhà 3.000 USD với 128GB VRAM để chạy LLM cục bộ

Một nhà phát triển đã tự lắp ráp máy chủ suy luận tại nhà trị giá 3.000 USD sử dụng 4 GPU AMD Radeon PRO V620 mang lại 128GB VRAM cùng với CPU AMD EPYC 7452 và 256GB RAM DDR4. Với bản vLLM tùy chỉnh, hệ thống đạt tốc độ prefill 1.300 token/giây và decode 60–70 token/giây trên các mô hình Qwen 3.8 được lượng thể hóa AutoRound W4A16 với cửa sổ ngữ cảnh trên 128k. Các máy trạm có VRAM dung lượng lớn thường có giá hàng chục nghìn USD, khiến các cấu hình tự dựng từ GPU doanh nghiệp giá rẻ trở thành giải pháp thay thế hấp dẫn để chạy các LLM nguồn mở lớn tại nhà. Thử nghiệm này cho thấy việc kết hợp dự đoán đa token (MTP) và lượng thể hóa nâng cao có thể mang lại hiệu suất suy luận nhanh trên phần cứng chi phí hợp lý. Hệ thống tiêu thụ lượng điện năng khá lớn, rút 700–900W ở giai đoạn prefill và 500–600W ở giai đoạn decode thông qua bộ nguồn ASRock 1.600W. Cấu hình này sử dụng bo mạch chủ socket kép giá rẻ Huananzhi D12D và 4 card trung tâm dữ liệu AMD Radeon PRO V620 được mua với tổng giá 1.400 USD.

## KIẾN THỨC NỀN

Tác vụ chạy mô hình ngôn ngữ lớn (LLM) cục bộ đòi hỏi dung lượng bộ nhớ video (VRAM) rất lớn để lưu giữ trọng số mô hình và bộ đệm key-value của ngữ cảnh. Lượng thể hóa AutoRound giúp nén trọng số LLM xuống mức bit thấp như 4-bit để giảm đáng kể dung lượng bộ nhớ cần thiết nhưng vẫn giữ được chất lượng mô hình. Bên cạnh đó, Dự đoán đa token (MTP) tăng tốc độ suy luận bằng cách cho phép mô hình dự đoán đồng thời nhiều token trong một bước tính toán thay vì tạo từng token một cách tuần tự.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Hardware#LocalLLaMA#LLM Inference#AMD#AI Workstation

$ subscribe --daily

Xây dựng máy chủ tại nhà 3.000 USD với 128GB VRAM để chạy LLM cục bộ | Daily News