Nvidia Vera Rubin đạt hiệu suất năng lượng gấp 30 lần Blackwell trong thử nghiệm DeepSeek-V4-PRO
Nvidia đã đánh giá kiến trúc Vera Rubin NVL72 sắp ra mắt bằng công cụ kiểm thử SemiAnalysis AgentX trên mô hình DeepSeek-v4-PRO 1.6T, cho thấy thông lượng trên mỗi megawatt tăng gấp 30 lần so với Blackwell GB300 NVL72. Ngoài ra, Vera Rubin được dự báo sẽ giảm chi phí cho mỗi triệu token xuống chỉ còn 1/35 so với Blackwell. Khi các mô hình AI mở rộng quy mô lên hàng nghìn tỷ tham số, hiệu suất năng lượng và chi phí trên mỗi token đã trở thành những nút thắt quan trọng đối với các trung tâm dữ liệu. Bước nhảy vọt về hiệu suất này cho thấy phần cứng thế hệ tiếp theo sẽ cho phép các nhà vận hành chạy các tác vụ AI dạng tác tử (agentic AI) phức tạp với mức tiêu thụ điện năng và ngân sách tài chính thấp hơn nhiều. Thử nghiệm này sử dụng SemiAnalysis AgentX, một công cụ đo lường các tác vụ suy luận của tác tử AI thông qua các chỉ số như độ trễ đầu-cuối và thời gian phản hồi token đầu tiên (TTFT). Để so sánh, bản thân Blackwell GB300 NVL72 đã mang lại thông lượng trên mỗi megawatt gấp 15 lần so với hệ thống H200 NVL8 dựa trên kiến trúc Hopper.
## KIẾN THỨC NỀN
Vera Rubin là kiến trúc GPU thế hệ tiếp theo của Nvidia kế nhiệm Blackwell, được thiết kế để coi toàn bộ trung tâm dữ liệu như một đơn vị tính toán duy nhất nhằm loại bỏ các nút thắt cổ chai về truyền thông. Thông lượng trên mỗi megawatt (tokens/MW) là một chỉ số quan trọng đối với các nhà máy AI, đại diện cho số lượng token có thể được tạo ra trong một hạn mức điện năng cố định.