Phát hành trọng số mở cho mô hình MoE Ling-3.0-flash-Fin
Trọng số mở cho Ling-3.0-flash-Fin đã được phát hành, giới thiệu kiến trúc Mixture-of-Experts (MoE) 124 tỷ tham số nhưng chỉ kích hoạt 5,1 tỷ tham số cho mỗi token. Mô hình cũng sở hữu cửa sổ ngữ cảnh nguyên bản cực lớn lên tới 256K token. Bằng cách cung cấp dung lượng tri thức của mô hình 124B với chi phí tính toán chỉ tương đương mô hình 5,1B tham số, bản phát hành này giảm đáng kể yêu cầu phần cứng khi triển khai cục bộ. Điều này giúp xử lý tài liệu dài và các nhiệm vụ chuyên biệt một cách hiệu quả về chi phí mà không làm giảm hiệu suất. Kiến trúc này sử dụng cơ chế định tuyến thưa (sparse routing) để chỉ kích hoạt 5,1 tỷ tham số khi suy luận trên tổng số 124 tỷ tham số. Ngoài ra, cửa sổ ngữ cảnh nguyên bản 256K của mô hình có thể mở rộng lên tới 1 triệu token cho các tác vụ xử lý ngữ cảnh siêu dài.
## KIẾN THỨC NỀN
Mixture of Experts (MoE) là một thiết kế mô hình trong đó các mạng con chuyên biệt ('chuyên gia') được kích hoạt chọn lọc trên từng token, mang lại dung lượng mô hình lớn mà không đòi hỏi toàn bộ sức mạnh tính toán cho mỗi token. Cửa sổ ngữ cảnh xác định lượng văn bản đầu vào mà mô hình ngôn ngữ có thể xử lý và ghi nhớ tại một thời điểm.