~/HARDWARE/installing-6x-tesla-v100-gpus-in-a-standard-tower-case-for-local

Lắp 6 GPU Tesla V100 vào vỏ máy tính tháp tiêu chuẩn để chạy LLM cục bộ

Một người dùng homelab đã lắp đặt thành công 6 GPU doanh nghiệp Nvidia Tesla V100 16GB vào vỏ máy tính tháp (full-tower) tiêu chuẩn thay vì dùng khung mở cồng kềnh. Cấu hình này sử dụng vi xử lý AMD EPYC 7262 và bo mạch chủ ASRock Rack ROMED8-2T để chạy các LLM cục bộ. Dự án này cho thấy người dùng cá nhân có thể đóng gói các hệ thống đa GPU mật độ cao vào thùng máy gia đình gọn gàng thay vì tủ rack máy chủ ồn ào. Nó thể hiện khả năng tái sử dụng hiệu quả các GPU máy chủ cũ giá rẻ cho việc chạy suy luận AI cục bộ bằng cách kết hợp các kỹ thuật song song hóa. Hệ thống cung cấp tổng cộng 96GB VRAM từ 6 card PCIe V100, với kế hoạch cấu hình suy luận mô hình bằng cách kết hợp Song song Tensor (TP2) và Song song Đường ống (PP3). Việc nhồi nhét 6 card chuẩn máy chủ vào một thùng máy PC duy nhất tạo ra thách thức lớn về luồng không khí, nguồn điện và không gian lắp đặt.

## KIẾN THỨC NỀN

Các mô hình ngôn ngữ lớn thường vượt quá dung lượng bộ nhớ của một GPU đơn lẻ, đòi hỏi các kỹ thuật song song hóa mô hình để chia nhỏ trọng số trên nhiều card. Song song Tensor chia các phép toán ma trận trên các GPU để đạt tốc độ cao, trong khi Song song Đường ống gán các lớp mô hình theo trình tự cho các GPU khác nhau. Các card máy chủ cũ như Nvidia Tesla V100 rất phổ biến trong cộng đồng homelab vì giá trên thị trường đồ cũ giúp việc mở rộng bộ nhớ đa GPU trở nên dễ tiếp cận hơn.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Hardware#LocalLLaMA#GPU#AI Inference#Homelab

$ subscribe --daily

Lắp 6 GPU Tesla V100 vào vỏ máy tính tháp tiêu chuẩn để chạy LLM cục bộ | Daily News