Bài học kinh nghiệm và đánh đổi chi phí khi huấn luyện mô hình ngôn ngữ Apex-2
Một nhà phát triển độc lập đã chia sẻ bài học thực tế từ quá trình huấn luyện mô hình Apex-2 với ngân sách 2.000 USD, nổi bật là việc áp dụng thuật toán huấn luyện phân tán DiLoCo trên hai nút GPU GH200 riêng biệt. Bằng cách gộp trọng số mô hình sau mỗi 350 bước, cấu hình này đạt tốc độ nhanh hơn 1,9 lần và hiệu suất MFU (Model FLOPs Utilization) đạt khoảng 40% trên mỗi GPU so với huấn luyện trên một GPU đơn lẻ. Thử nghiệm này cho thấy các thuật toán phân tán như DiLoCo có thể giúp bình dân hóa việc huấn luyện LLM đa nút mà không cần kết nối băng thông siêu cao đắt đỏ như NVLink giữa các nút. Đây là dữ liệu thực tế giá trị cho các nhà nghiên cứu có ngân sách hạn chế muốn tối ưu hóa việc lọc dữ liệu trùng lặp và hiệu suất tính toán của phần cứng. Việc loại bỏ dữ liệu trùng lặp giữa các bản chụp (snapshot) bằng MinHash đã loại bỏ 57% mẫu FineWeb-Edu và 34% mẫu DCLM, mặc dù tác giả lưu ý đây là sự đánh đổi chi phí chứ không hẳn giúp tăng chất lượng mô hình. Do giới hạn kinh phí và năng lực tính toán, lượng token huấn luyện thực tế đã phải giảm từ mục tiêu 1.000 tỷ (1T) token xuống còn 80 tỷ (80B) token trên kiến trúc Mixture-of-Experts (MoE) dựa theo Mixtral.
## KIẾN THỨC NỀN
DiLoCo (Distributed Low-Communication) là thuật toán tối ưu hóa cho phép huấn luyện các mô hình ngôn ngữ lớn trên các cụm máy tính có kết nối mạng kém bằng cách chỉ truyền tải các bản cập nhật trọng số sau nhiều bước huấn luyện cục bộ. MFU (Model FLOPs Utilization) đo lường tỷ lệ giữa các phép tính số thực phẩy động thực tế đạt được so with hiệu năng lý thuyết tối đa của GPU. FineWeb-Edu là bộ dữ liệu web quy mô lớn do Hugging Face công bố, được lọc bằng các bộ phân loại LLM để giữ lại văn bản giáo dục chất lượng cao.