Thử Nghiệm Cụm AMD Ryzen AI Halo Cho Kết Quả Kém Ấn Tượng
LTT Labs đã thử nghiệm kết hợp hai APU AMD Ryzen AI Halo thành một cụm bằng phương thức gọi thủ tục từ xa (RPC) để chạy suy luận mô hình ngôn ngữ lớn (LLM) cục bộ. Dù làm theo hướng dẫn chính thức của AMD, họ chỉ nhận lại kết quả hiệu năng kém ấn tượng và đã chia sẻ dữ liệu thử nghiệm sớm này để thảo luận cùng cộng đồng. AMD Ryzen AI Halo rất được mong đợi cho các tác vụ AI cục bộ nhờ bộ nhớ thống nhất băng thông cao, khiến các thử nghiệm ghép cụm trở nên quan trọng để mở rộng dung lượng chạy LLM. Kết quả kém ấn tượng ban đầu này làm nổi bật các nút thắt cổ chai về phần mềm và mạng lưới cần được giải quyết trước khi cấu hình đa APU có thể khả thi cho người dùng phổ thông. Thử nghiệm đã sử dụng bộ phần mềm ROCm của AMD và máy chủ RPC của llama.cpp để phân chia khối lượng công việc giữa hai hệ thống APU chạy Linux. Mặc dù thiết lập này cho phép chạy các mô hình lớn hơn nhờ gộp chung bộ nhớ, nhưng chi phí truyền thông của RPC qua kết nối mạng thông thường thường làm giảm tốc độ tạo token.
## KIẾN THỨC NỀN
Các APU Ryzen AI Halo của AMD sở hữu đồ họa tích hợp mạnh mẽ và bộ nhớ thống nhất, rất lý tưởng để chạy các LLM cục bộ mà không cần GPU rời đắt đỏ. Việc ghép cụm bằng RPC (Remote Procedure Call) trong llama.cpp cho phép nhiều máy tính phân chia tải tính toán và yêu cầu bộ nhớ của một mô hình AI duy nhất qua mạng nội bộ.