Meta Ra Mắt MobileMoE: Các Mô Hình Hỗn Hợp Chuyên Gia Hiệu Quả Trên Thiết Bị Di Động
Meta đã phát hành MobileMoE, một dòng mô hình ngôn ngữ Hỗn hợp Chuyên gia (MoE) chạy trực tiếp trên thiết bị với số lượng tham số hoạt động từ 0,3B đến 0,9B (tổng số tham số từ 1,3B đến 5,3B). Các mô hình này được thiết kế để vừa vặn với giới hạn bộ nhớ DRAM của thiết bị di động nhờ kích thước tệp trọng số INT4 dưới 3 GB. Sự kiện này thúc đẩy khả năng chạy các mô hình ngôn ngữ lớn, chất lượng cao trực tiếp trên thiết bị di động mà không cần phụ thuộc vào hạ tầng đám mây. Bằng cách sử dụng kiến trúc MoE, các mô hình này tối ưu hóa sự cân bằng giữa hiệu suất tính toán và chất lượng mô hình. MobileMoE được cung cấp với ba quy mô (S, M và L) cùng ba biến thể cho mỗi quy mô bao gồm: Base, SFT (tinh chỉnh có giám sát) và QAT (huấn luyện nhận biết lượng tử hóa). Mô hình lớn nhất, MobileMoE-L, sở hữu 922 triệu tham số hoạt động, 60 chuyên gia định tuyến (với 4 chuyên gia hoạt động cho mỗi token) và cơ chế Chú ý Truy vấn Nhóm (GQA).
## KIẾN THỨC NỀN
Hỗn hợp Chuyên gia (MoE) là một kỹ thuật học máy giúp định tuyến các token đầu vào đến các mạng con chuyên biệt ("chuyên gia") thay vì kích hoạt toàn bộ mô hình, từ đó giảm yêu cầu tính toán. Cơ chế Chú ý Truy vấn Nhóm (GQA) tối ưu hóa việc sử dụng bộ nhớ bằng cách nhóm các đầu truy vấn (query heads) để chia sẻ chung các đầu khóa-giá trị (key-value heads). Huấn luyện nhận biết lượng tử hóa (QAT) mô phỏng các tác động của việc lượng tử hóa độ chính xác thấp trong quá trình huấn luyện nhằm duy trì độ chính xác khi mô hình được nén lại.