inclusionAI ra mắt Ling-3.0-tiny, mô hình MoE cục bộ tốc độ cao
Nhóm phát triển Ling đã phát hành Ling-3.0-tiny, một mô hình Mixture of Experts (MoE) mã nguồn mở với tổng cộng 8 tỷ tham số và 1,3 tỷ tham số hoạt động. Mô hình này được thiết kế để suy luận cục bộ tốc độ cao, tiếp nối phiên bản Ling-3.0-flash lớn hơn được ra mắt trước đó. Các mô hình MoE nhỏ mang lại sự cân bằng hấp dẫn cho việc triển khai LLM cục bộ bằng cách cung cấp hiệu năng của các mô hình lớn hơn trong khi vẫn duy trì dung lượng bộ nhớ thấp và tốc độ tạo văn bản cao. Bản phát hành này giúp các trợ lý AI cục bộ hiệu quả và có thông lượng cao trở nên dễ tiếp cận hơn trên phần cứng tiêu dùng như MacBook. Ở định dạng FP8, Ling-3.0-tiny đạt tốc độ 100-105 token/giây trên DGX Spark và 86-90 token/giây trên MacBook M4 Pro. Mô hình yêu cầu bộ nhớ đỉnh khoảng 8,34 GiB ở độ dài ngữ cảnh 8K, với hiệu năng nằm giữa các mô hình Qwen và Gemma từ 4B đến 8-12B.
## KIẾN THỨC NỀN
Kiến trúc Mixture of Experts (MoE) sử dụng cơ chế định tuyến để chỉ dẫn các đầu vào đến một phần nhỏ trong tổng số tham số (tham số hoạt động) cho mỗi token. Điều này cho phép mô hình chạy với tốc độ của một mô hình nhỏ hơn (dựa trên các tham số hoạt động) trong khi vẫn giữ được dung lượng và tri thức của một mô hình lớn hơn (dựa trên tổng số tham số), mặc dù nó vẫn yêu cầu bộ nhớ để tải toàn bộ mô hình.