Cursor mở nguồn mở Mixture-of-Kittens (MoK) giúp huấn luyện MoE nhanh hơn trên NVL72
Cursor đã mở nguồn mở Mixture-of-Kittens (MoK), một megakernel huấn luyện Mixture-of-Experts (MoE) có tính tất định được thiết kế cho các hệ thống NVIDIA NVL72. Kernel này tích hợp toàn bộ quá trình truyền thông và tính toán của MoE, đạt tốc độ nhanh hơn tới 2,37 lần so với các baseline công khai mạnh nhất. Việc huấn luyện các mô hình MoE quy mô lớn tiêu tốn rất nhiều tài nguyên, và độ trễ truyền thông giữa các GPU thường là nút thắt cổ chai lớn. Bằng cách tăng tốc đáng kể quá trình huấn luyện trên kiến trúc NVL72 mới nhất của NVIDIA, MoK có thể giảm thời gian và chi phí huấn luyện cho các mô hình AI tiên tiến. MoK hoạt động như một megakernel đơn lẻ, hoàn toàn tất định, giúp loại bỏ ranh giới giữa các kernel và đảm bảo kết quả huấn luyện có thể tái lập. Nó được tối ưu hóa đặc biệt cho các hệ thống dạng tủ rack NVL72, vốn sử dụng tản nhiệt chất lỏng và kết nối CPU Grace với GPU Blackwell.
## KIẾN THỨC NỀN
Mixture-of-Experts (MoE) là một kiến trúc học máy sử dụng cơ chế định tuyến để chuyển hướng dữ liệu đầu vào đến các phân vùng mạng "chuyên gia" (expert) cụ thể nhằm nâng cao hiệu suất. Megakernel là một kỹ thuật tối ưu hóa GPU giúp hợp nhất nhiều hoạt động và bước truyền thông vào một lần kích hoạt kernel duy nhất để giảm thiểu độ trễ. NVIDIA GB200 NVL72 là một hệ thống máy tính dạng tủ rack kết nối 36 CPU Grace và 72 GPU Blackwell bằng NVLink.