~/HARDWARE/diy-cluster-of-repurposed-crypto-mining-boards-runs-distributed-llm-inference

Cụm máy chủ tự dựng từ bo mạch đào coin cũ chạy suy luận LLM phân tán

Một người dùng Reddit đã chia sẻ cấu hình phần cứng tự dựng kết hợp 6 bo mạch đào tiền điện tử AMD BC-250 cũ để chạy suy luận LLM phân tán qua llama.cpp với backend RPC và Vulkan trên mạng Ethernet 1Gb. Hệ thống chạy thành công các mô hình ngữ cảnh lớn như Qwen Next Flash IQ2_XS (lên tới 100k context) trên 4 bo mạch, trong khi 2 bo mạch còn lại chạy mô hình 35B Q4 với tốc độ 60 token/giây. Dự án cho thấy khả năng tái sử dụng phần cứng đào coin giá rẻ cho việc chạy suy luận AI cục bộ với dung lượng bộ nhớ lớn ở tốc độ ấn tượng. Điều này khẳng định sức mạnh của các công cụ mã nguồn mở như llama.cpp RPC trong việc tận dụng băng thông bộ nhớ từ nhiều bo mạch giá rẻ thay vì phải mua GPU doanh nghiệp đắt đỏ. Cụm phần cứng đặt 5 bo mạch BC-250 trong vỏ máy ASRock 4U12G kết hợp quạt tản nhiệt tự chế, giao tiếp qua mạng Ethernet 1Gb tiêu chuẩn. Các chỉ số hiệu năng đạt được gồm 28 token/giây khi sinh văn bản trên Qwen Next Flash IQ2_XS (xử lý đầu vào 115 ppt ở ngữ cảnh 50k) và 450 ppt đối với mô hình 35B Q4.

## KIẾN THỨC NỀN

AMD BC-250 là bo mạch đào coin chuyên dụng tận dụng chip APU rút gọn từ PlayStation 5 cùng 16GB bộ nhớ GDDR6 tốc độ cao. Trong khi đó, llama.cpp là công cụ suy luận LLM mã nguồn mở tích hợp tính năng RPC (Remote Procedure Call), cho phép phân tán các lớp của mô hình và tính toán trên nhiều thiết bị kết nối qua mạng.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#hardware#local-ai#llama-cpp#distributed-inference#homelab

$ subscribe --daily

Cụm máy chủ tự dựng từ bo mạch đào coin cũ chạy suy luận LLM phân tán | Daily News