MLPerf Inference 6.1 Ra Mắt: AMD Đạt Kỷ Lục Với 512 GPU MI355X, NVIDIA Vera Rubin Lần Đầu Xuất Hiện
MLCommons đã công bố kết quả thử nghiệm MLPerf Inference v6.1, nổi bật với việc AMD mở rộng cụm 512 GPU Instinct MI355X để xử lý mô hình DeepSeek R1 đạt tốc độ lên tới 2,9 triệu token/giây. Đợt phát hành kết quả này cũng ghi nhận lần đầu tiên kiến trúc thế hệ mới Vera Rubin (VR200) của NVIDIA tham gia thử nghiệm hiệu năng công khai. Các kết quả này cho thấy AMD có khả năng triển khai thành công các cụm 512 GPU quy mô lớn cho những mô hình suy luận phức tạp như DeepSeek R1, tạo ra sự cạnh tranh mạnh mẽ với NVIDIA trong mảng suy luận AI quy mô lớn. Ngoài ra, những con số ban đầu của Vera Rubin cho thấy bước nhảy vọt về hiệu năng so với thế hệ Blackwell hiện tại của NVIDIA. Cụm 512 GPU MI355X của AMD đạt 2.901.950 token/giây ở chế độ ngoại tuyến (offline) và 2.405.310 token/giây ở chế độ máy chủ (server) trên mô hình DeepSeek R1. Trong các bài kiểm tra so sánh, NVIDIA Vera Rubin VR200 nhanh hơn 95% so với cấu hình GB300 ở cùng quy mô 72 GPU, thậm chí bản VR200 36 GPU còn vượt qua cả cấu hình GB200 72 GPU.
## KIẾN THỨC NỀN
MLPerf Inference là bộ công cụ kiểm thử chuẩn của ngành do tổ chức MLCommons duy trì nhằm đo lường băng thông và độ trễ của phần cứng trong các kịch bản triển khai khác nhau như xử lý theo lô (offline) hay chế độ máy chủ tương tác (server). AMD Instinct MI355X được xây dựng trên kiến trúc CDNA tối ưu cho các tác vụ AI, trong khi nền tảng Vera Rubin của NVIDIA là kiến trúc cờ đầu thế hệ tiếp theo nối tiếp dòng Blackwell (GB200/GB300).