Ant Group nguồn mở mô hình MoE Ling-3.0-tiny hỗ trợ triển khai cục bộ
Ant Group đã mở nguồn mở Ling-3.0-tiny, một mô hình hỗn hợp chuyên gia (MoE) gọn nhẹ với 7,9 tỷ tham số được thiết kế để suy luận cục bộ với chi phí thấp. Mô hình này sử dụng kiến trúc lai kết hợp giữa Kimi Delta Attention (KDA) và Multi-Head Latent Attention (MLA) nhằm tối ưu hóa hiệu suất trên phần cứng tiêu dùng. Việc phát hành mô hình này thúc đẩy khả năng chạy các mô hình ngôn ngữ lớn (LLM) cục bộ trên các thiết bị tiêu dùng như máy Mac chạy chip Apple Silicon, đạt tốc độ suy luận cao lên tới 90 token/giây trên chip M4 Pro. Nó chứng minh tính ứng dụng thực tiễn của các cơ chế chú ý lai để cân bằng giữa chi phí tính toán và khả năng xử lý ngữ cảnh. Ling-3.0-tiny chỉ kích hoạt 1,3 tỷ tham số cho mỗi token và sở hữu mạng truyền thẳng MoE thưa với 128 chuyên gia định tuyến. Mô hình hỗ trợ các định dạng lượng tử hóa BF16, FP8 và INT4, chỉ yêu cầu khoảng 8,34 GiB bộ nhớ đỉnh cho chiều dài ngữ cảnh 8K.
## KIẾN THỨC NỀN
Cơ chế Multi-Head Latent Attention (MLA), được phổ biến bởi DeepSeek-V2, nén các phép chiếu key-value (KV) thành một biểu diễn ẩn để giảm đáng kể nút thắt cổ chai bộ nhớ của KV-cache. Trong khi đó, Kimi Delta Attention (KDA) là một cơ chế chú ý tuyến tính giúp cải thiện độ trung thực của biểu diễn và hiệu quả bộ nhớ bằng cách sử dụng cơ chế cổng theo từng kênh (channel-wise gating).