Một người dùng Reddit chia sẻ hành trình nhiều năm tự dựng cụm GPU chạy AI cục bộ
Một người dùng Reddit đã chia sẻ hành trình nhiều năm từ 2023 đến 2026 tự dựng một cụm máy chủ AI cục bộ, nâng cấp từ một GPU chơi game đơn lẻ lên hệ thống chuyên dụng chạy bốn GPU RTX 6000 và bốn GPU RTX 3090. Hệ thống này hiện được sử dụng để phát triển khởi nghiệp và vận hành một trợ lý cá nhân cục bộ được tùy biến sâu. Dự án này chứng minh những thách thức thực tế và động lực, chẳng hạn như bảo mật dữ liệu và độ tin cậy ngoại tuyến, đằng sau việc xây dựng cơ sở hạ tầng LLM cục bộ cao cấp. Nó nhấn mạnh rằng mặc dù điện toán đám mây thường rẻ hơn, phần cứng cục bộ vẫn mang lại cho những người đam mê và nhà phát triển quyền kiểm soát hoàn toàn đối với quy trình làm việc và sự ổn định của API. Máy chủ được xây dựng trên bo mạch chủ ASROCK ROMED8-2T với CPU AMD Epyc 7003 64 nhân và 512 GB RAM DDR4, sử dụng khung trâu cày để chứa các GPU. Người dựng đã gặp phải các sự cố nghiêm trọng về kết nối PCIe, lỗi nguồn điện suýt gây hỏa hoạn, và lưu ý rằng họ phải giới hạn công suất của các card RTX 3090 ở mức 150W để duy trì sự ổn định.
## KIẾN THỨC NỀN
Việc vận hành các mô hình ngôn ngữ lớn (LLM) cục bộ đòi hỏi bộ nhớ video (VRAM) khổng lồ, thúc đẩy những người đam mê tự dựng các dàn máy đa GPU tùy chỉnh. Cấu hình này được lấy cảm hứng từ ý tưởng "WOPR", một thiết kế máy chủ tự chế (DIY) sử dụng cáp nối PCIe và khung trâu cày để chứa nhiều GPU cao cấp. Ngoài ra, người dùng đã nâng cấp phần cứng để chạy Goliath 120B, một mô hình hợp nhất từ hai mô hình Llama 70B đòi hỏi tài nguyên phần cứng rất lớn để hoạt động hiệu quả.