Cursor Triển Khai 'MoK' Giúp Tăng 1,41 Lần Hiệu Suất Huấn Luyện Trên GPU
Cursor đã triển khai một thành phần ngăn xếp huấn luyện mới mang tên 'MoK' để vận hành quá trình huấn luyện phân tán trên hàng chục nghìn GPU. Việc triển khai này giúp tăng 1,41 lần hiệu suất huấn luyện đầu-cuối (end-to-end) so với hệ thống dựa trên DeepEP trước đây của họ. Đạt được mức tăng hiệu suất 1,41 lần ở quy mô hàng chục nghìn GPU là một cột mốc quan trọng đối với cơ sở hạ tầng học máy. Điều này chứng minh rằng việc tối ưu hóa giao tiếp và ngăn xếp huấn luyện có thể mang lại hiệu quả vượt trội so với các giải pháp tiên tiến hiện nay như DeepEP. Mặc dù các chi tiết kỹ thuật cụ thể về kiến trúc của MoK vẫn chưa được tiết lộ, hiệu suất cải tiến này đã được ghi nhận trực tiếp trong môi trường sản xuất thực tế. Hệ thống đối chứng trước đó, DeepEP, vốn là một thư viện giao tiếp được tối ưu hóa cao do DeepSeek thiết kế cho các mô hình Mixture-of-Experts (MoE).
## KIẾN THỨC NỀN
Huấn luyện AI quy mô lớn đòi hỏi sự phối hợp của hàng chục nghìn GPU, nơi mà độ trễ giao tiếp thường trở thành nút thắt cổ chai chính. DeepEP (DeepEveryParallel) là một thư viện giao tiếp nguồn mở hiệu năng cao do DeepSeek phát triển riêng cho các mô hình Mixture-of-Experts (MoE) và song song hóa chuyên gia (expert parallelism). Việc tối ưu hóa các cơ chế giao tiếp này là yếu tố quyết định để tăng tốc độ huấn luyện và giảm chi phí cơ sở hạ tầng.