~/MACHINE LEAR/china-telecom-ai-releases-xing4-0-29b-a4b-moe-model-trained-on

China Telecom AI ra mắt mô hình Xing4.0-29B-A4B MoE huấn luyện trên NPU Huawei Ascend

China Telecom AI đã ra mắt Xing4.0-29B-A4B, một mô hình ngôn ngữ Mixture-of-Experts (MoE) mã nguồn mở có tổng cộng 29 tỷ tham số với 4 tỷ tham số được kích hoạt cho mỗi token và cửa sổ ngữ cảnh gốc 256K. Mô hình gây chú ý khi là mô hình đầu tiên ở quy mô này được huấn luyện hoàn toàn trên cụm NPU Huawei Ascend 910C sử dụng khung làm việc MindSpore. Việc phát hành mô hình này cho thấy khả năng ngày càng tăng của Trung Quốc trong việc huấn luyện các mô hình AI tiên tiến trực tiếp trên phần cứng Huawei nội địa mà không cần phụ thuộc vào GPU Nvidia. Kiến trúc hướng đại lý (agent-oriented) cùng mức kích hoạt hiệu quả 4 tỷ tham số giúp mô hình rất phù hợp cho các tác vụ suy luận phức tạp và triển khai doanh nghiệp với chi phí thấp. Được xây dựng trên các kiến trúc mHC, Multi-head Latent Attention (MLA) và Multi-Token Prediction (MTP), mô hình sử dụng 64 chuyên gia định tuyến (routed experts) và 1 chuyên gia chia sẻ, kích hoạt 4 chuyên gia trên mỗi token. Các giải pháp tối ưu hóa đồng thời như toán tử hợp nhất Ascend C mHC và tối ưu hóa truyền thông MoE mịn giúp tăng hiệu suất huấn luyện lên khoảng 96% so với mức tiêu chuẩn.

## KIẾN THỨC NỀN

Mixture-of-Experts (MoE) là kiến trúc định tuyến dữ liệu đầu vào đến các mạng con chuyên biệt, giúp giữ chi phí tính toán thấp trong quá trình suy luận nhưng vẫn duy trì tổng số lượng tham số lớn. NPU Ascend của Huawei và khung phần mềm MindSpore đại diện cho hệ sinh thái thay thế nội địa của Trung Quốc đối với nền tảng GPU và CUDA của Nvidia.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Machine Learning#LLM#MoE#Open Source AI#Hardware

$ subscribe --daily

China Telecom AI ra mắt mô hình Xing4.0-29B-A4B MoE huấn luyện trên NPU Huawei Ascend | Daily News