Nhà phát triển ML huấn luyện mô hình MoE 3,87B tham số từ đầu chỉ với 86,5B token
Một nhà phát triển mã nguồn mở đã huấn luyện thành công Apex-2, một mô hình ngôn ngữ Mixture-of-Experts (MoE) 3,87 tỷ tham số (1,45 tỷ tham số kích hoạt mỗi token), hoàn toàn từ đầu chỉ với 86,5 tỷ token tiền huấn luyện. Sử dụng GPU GH200 và thuật toán huấn luyện phân tán DiLoCo, mô hình đạt hiệu suất đánh giá lập trình tương đương với các mô hình được huấn luyện trên lượng dữ liệu lớn hơn nhiều như Qwen2.5-1.5B. Dự án này chứng minh rằng các nhà nghiên cứu độc lập có thể tự tiền huấn luyện các kiến trúc MoE tùy chỉnh có hiệu suất cao với ngân sách tính toán khiêm tốn và lượng token hạn chế. Kết quả này làm nổi bật hiệu quả thực tế của kiến trúc MoE thưa và các thuật toán huấn luyện phân tán tiết kiệm băng thông như DiLoCo trong việc giảm rào cản tài nguyên cho phát triển LLM. Apex-2 gồm 32 lớp với 16 expert mỗi lớp (định tuyến top-4), sử dụng Grouped-Query Attention (GQA) và độ dài ngữ cảnh 4.096 token với bộ phân tích từ vựng Qwen3. Mặc dù tinh chỉnh SFT (~2,5B token) mang lại điểm số lập trình ấn tượng (HumanEval 43.9, HumanEval+ 41.5), việc áp dụng Tối ưu hóa Sở thích Trực tiếp (DPO) lại làm giảm hiệu suất toán và lập trình, khiến tác giả quyết định giữ lại checkpoint SFT.
## KIẾN THỨC NỀN
Kiến trúc Mixture-of-Experts (MoE) định tuyến các token đầu vào đến một tập hợp con các mạng con chuyên biệt (expert), giúp mở rộng tổng số tham số mô hình nhưng vẫn giữ chi phí tính toán trên mỗi token ở mức thấp. DiLoCo (Distributed Low-Communication) là thuật toán huấn luyện giúp giảm đáng kể chi phí giao tiếp truyền thông giữa các thiết bị, cho phép huấn luyện LLM hiệu quả trên các cụm GPU kết nối kém. Direct Preference Optimization (DPO) là kỹ thuật căn chỉnh nhằm tinh chỉnh đầu ra mô hình theo sở thích con người mà không cần huấn luyện mô hình thưởng riêng biệt.