~/HARDWARE/scaling-a-home-lab-to-run-frontier-class-open-ai-models

Nâng cấp phòng thí nghiệm tại nhà để chạy các mô hình AI mở hàng đầu

Một người đam mê AI cục bộ đã chia sẻ hành trình nâng cấp hạ tầng AI tại nhà từ một card RTX 3090 đơn lẻ lên cụm 20 nút DGX Spark kết nối giữa hai nhà láng giềng. Hệ thống này cho phép suy luận ngoại tuyến cục bộ cho các mô hình nguồn mở khổng lồ như Kimi K3 (2.8T) và DeepSeek 671B. Dự án chứng minh rằng các nhà phát triển cá nhân có thể tự chạy các mô hình nguồn mở cấp hàng đầu hoàn toàn ngoại tuyến để bảo mật dữ liệu và kiểm soát chi phí lâu dài. Nó cũng làm nổi bật các giới hạn vật lý thực tế của homelab cực độ, bao gồm giới hạn điện lưới gia đình, tản nhiệt và băng thông kết nối liên nút tốc độ cao. Cấu hình phần cứng phát triển từ việc chuyển tải sang RAM DDR4 của CPU đến cụm 16 card RTX 3090 tiêu thụ 6kW làm liên tục nhảy cầu chì gia đình, trước khi chuyển sang các nút ASUS GB10 (DGX Spark) tiết kiệm điện hơn. Được kết nối qua mạng 100Gbit và chạy các bản dựng vLLM/SGLang tối ưu, cụm máy kết hợp đạt tốc độ lên tới 20 token/giây ngay cả ở cửa sổ ngữ cảnh 300k.

## KIẾN THỨC NỀN

Việc vận hành các mô hình ngôn ngữ lớn cục bộ đòi hỏi tài nguyên tính toán và băng thông bộ nhớ GPU rất lớn. Các kiến trúc như Mixture of Experts (MoE) giúp giảm chi phí tính toán bằng cách chỉ kích hoạt một phần tham số cho mỗi token, giúp các mô hình như DeepSeek 671B hoạt động hiệu quả hơn. Bên cạnh đó, suy luận LLM phụ thuộc vào giai đoạn prefill nặng về tính toán để xử lý ngữ cảnh đầu vào và giai đoạn decode nặng về bộ nhớ, khiến kết nối tốc độ cao giữa các GPU trở nên quan trọng khi xử lý cửa sổ ngữ cảnh dài.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#hardware#local-ai#llm-inference#gpu-clusters#home-lab

$ subscribe --daily

Nâng cấp phòng thí nghiệm tại nhà để chạy các mô hình AI mở hàng đầu | Daily News