Moonshot AI công bố mã nguồn mở mô hình Kimi K3 với 2,8 nghìn tỷ tham số
Moonshot AI đã chính thức mở nguồn mở Kimi K3, một mô hình hỗn hợp chuyên gia (MoE) khổng lồ với 2,8 nghìn tỷ tham số và cửa sổ ngữ cảnh 1 triệu token. Cùng với trọng số mô hình và báo cáo kỹ thuật, công ty cũng phát hành cơ sở hạ tầng huấn luyện cốt lõi bao gồm MoonEP, FlashKDA và AgentEnv. Kimi K3 thiết lập một cột mốc mới về quy mô của các mô hình ngôn ngữ lớn (LLM) mã nguồn mở, chứng minh rằng các mô hình mở có thể mở rộng lên tới hàng nghìn tỷ tham số. Việc phát hành cơ sở hạ tầng huấn luyện đi kèm cung cấp cho cộng đồng AI các công cụ giá trị để tối ưu hóa truyền thông hiệu năng cao và học tăng cường phân tán. Mô hình sử dụng cơ chế Kimi Delta Attention (KDA) và khung Stable LatentMoE, cho phép kích hoạt hiệu quả 16 trong số 896 chuyên gia và đạt hiệu suất mở rộng gấp 2,5 lần so với Kimi K2. Tuy nhiên, giấy phép của mô hình yêu cầu một thỏa thuận riêng đối với các doanh nghiệp cung cấp dịch vụ mô hình (MaaS) có doanh thu vượt quá 20 triệu USD.
## KIẾN THỨC NỀN
Hỗn hợp chuyên gia (MoE) là một kiến trúc chỉ kích hoạt một phần nhỏ các tham số của mô hình cho mỗi đầu vào, giúp giảm chi phí tính toán. Kimi Delta Attention (KDA) là một cơ chế chú ý tuyến tính được thiết kế để tối ưu hóa việc sử dụng bộ nhớ cho xử lý ngữ cảnh dài, trong khi LatentMoE chiếu các luồng định tuyến vào một không gian ẩn để giảm thiểu nghẽn băng thông bộ nhớ.