~/AMD/amd-releases-instella-moe-a-16b-open-source-model-trained-on-own

AMD ra mắt Instella-MoE, mô hình nguồn mở 16B được huấn luyện trên phần cứng tự phát triển

AMD đã công bố dòng mô hình Instella-MoE, một bộ sưu tập các mô hình Hỗn hợp chuyên gia (MoE) mã nguồn mở với 16 tỷ tham số. Các mô hình này được huấn luyện từ đầu hoàn toàn trên GPU AMD Instinct MI300X và MI325X bằng cách sử dụng ngăn xếp phần mềm ROCm. Sự kiện này chứng minh khả năng của AMD trong việc huấn luyện các mô hình MoE cạnh tranh và tiên tiến từ đầu đến cuối bằng hệ sinh thái phần cứng và phần mềm của riêng mình. Điều này thúc đẩy sự đa dạng phần cứng trong ngành AI, mang lại một giải pháp thay thế khả thi cho nền tảng CUDA đang thống trị của Nvidia. Mô hình này có 2,8 tỷ tham số kích hoạt, kiến trúc bộ giải mã 27 lớp và tích hợp cơ chế Chú ý ẩn đa đầu có cổng (Gated MLA). Quá trình huấn luyện đã sử dụng thư viện FarSkip-Collective giúp tăng tốc độ tiền huấn luyện thêm 12,7%, trong khi khung suy luận SGLang giúp giảm thời gian phản hồi token đầu tiên (TTFT) lên tới 39,2%.

## KIẾN THỨC NỀN

Hỗn hợp chuyên gia (MoE) là một kỹ thuật học máy định tuyến dữ liệu đầu vào đến các mạng con 'chuyên gia' chuyên biệt, cho phép các mô hình mở rộng tham số trong khi vẫn giữ chi phí tính toán ở mức thấp. ROCm của AMD là một nền tảng phần mềm mã nguồn mở dành cho tính toán tăng tốc bằng GPU, đóng vai trò là đối thủ cạnh tranh chính của AMD với nền tảng CUDA độc quyền của Nvidia.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AMD#Mixture of Experts#Open Source AI#LLM#Machine Learning

$ subscribe --daily