Huawei Ascend Đạt Nhất Quán Huấn Luyện - Suy Luận Trong Học Tăng Cường, Tăng 60% Hiệu Năng
Huawei Ascend đã đạt được sự nhất quán hoàn toàn giữa huấn luyện và suy luận (chỉ số logdiff bằng 0) trong học tăng cường cho LLM bằng ngôn ngữ lập trình Ascend C. Thử nghiệm trên mô hình Qwen3-30B MoE cho thấy giải pháp này giúp tăng hiệu năng từ 20% đến 60% ở chế độ Eager nhờ tối ưu hóa các toán tử FlashAttention. Sự khác biệt về mặt số học giữa công cụ suy luận (rollout) và công cụ huấn luyện thường làm mất ổn định quá trình học tăng cường cho các mô hình ngôn ngữ lớn. Việc giải quyết thách thức cấp hệ thống này mà không làm giảm hiệu năng giúp củng cố vị thế của hệ sinh thái Ascend trong việc hậu huấn luyện LLM nâng cao. Sự bất nhất quán được giải quyết bằng cách đồng bộ hóa các đường dẫn số học của toán tử, bao gồm thống nhất ngữ nghĩa attention, khóa thứ tự tích lũy reduce và khớp các chiến lược phân mảnh Softmax trực tuyến. Huawei đã mã nguồn mở các giải pháp này và có kế hoạch phát hành công cụ giúp nhà phát triển xác định các vấn đề logdiff còn sót lại.
## KIẾN THỨC NỀN
Trong học tăng cường cho LLM, công cụ rollout tạo ra các chuỗi văn bản (suy luận) trong khi công cụ huấn luyện cập nhật các tham số của mô hình. Do các phép toán số thực dấu phẩy động không có tính chất kết hợp, những khác biệt nhỏ trong đường dẫn thực thi phần cứng, chiến lược song song hóa hoặc phân mảnh toán tử giữa hai công cụ này sẽ dẫn đến kết quả đầu ra khác nhau (được đo bằng logdiff), gây ảnh hưởng xấu đến sự ổn định của quá trình huấn luyện.