~/NVIDIA BLACK/nvidia-blackwell-gb300-sets-moe-pre-training-record-with-deepseek-v3

Nvidia Blackwell GB300 lập kỷ lục huấn luyện MoE với DeepSeek-v3

Nvidia thông báo nền tảng Blackwell GB300 NVL72 của họ đã đạt hiệu năng kỷ lục 1.648 TFLOPs trên mỗi GPU trong quá trình tiền huấn luyện mô hình DeepSeek-v3 671B. Kết quả này đánh dấu mức tăng hiệu suất 50% so với các thử nghiệm vào tháng 11 năm 2025 và tăng gần gấp ba lần so với thế hệ GB200 trước đó. Cột mốc này chứng minh những tiến bộ vượt bậc về hiệu suất phần cứng AI, cho phép các tổ chức huấn luyện các mô hình hỗn hợp chuyên gia (MoE) khổng lồ với ít tài nguyên phần cứng hơn và chi phí tính toán thấp hơn. Kỷ lục này đạt được khi sử dụng 256 GPU để huấn luyện mô hình 671 tỷ tham số, nhờ vào 38 giải pháp tối ưu hóa hệ thống lớn được phát hiện qua 1,4 triệu giờ thử nghiệm GPU.

## KIẾN THỨC NỀN

Hỗn hợp chuyên gia (MoE) là một kiến trúc học máy chia mô hình lớn thành các mạng con nhỏ hơn, chỉ kích hoạt một phần trong số chúng cho mỗi token để giảm chi phí tính toán. Nvidia GB300 NVL72 là hệ thống dạng tủ rack làm mát bằng chất lỏng tích hợp 72 GPU Blackwell Ultra và 36 CPU Grace, được thiết kế để hoạt động như một nút siêu máy tính hiệu năng cao duy nhất.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Nvidia Blackwell#DeepSeek-v3#Mixture of Experts (MoE)#AI Hardware#Distributed Training

$ subscribe --daily