Thắc mắc của cộng đồng về việc chạy mô hình Ling 3.0 Tiny trên CPU
Người dùng trong cộng đồng AI cục bộ đang tìm hiểu về trải nghiệm và hiệu suất khi chạy Ling 3.0 Tiny trực tiếp trên CPU. Ling 3.0 Tiny là mô hình Mixture-of-Experts (MoE) 7,9 tỷ tham số do InclusionAI phát triển, chỉ kích hoạt 1,3 tỷ tham số trên mỗi token. Với chỉ 1,3 tỷ tham số kích hoạt, Ling 3.0 Tiny giảm đáng kể yêu cầu về băng thông bộ nhớ, giúp khả năng hoạt động của các LLM phức tạp trở nên khả thi trên phần cứng không có GPU chuyên dụng. Điều này giúp người dùng dễ dàng tiếp cận khả năng suy luận cục bộ chất lượng cao trên các môi trường thiết bị cấu hình thấp. Ling 3.0 Tiny sở hữu khả năng suy luận hỗn hợp tự nhiên và hỗ trợ chuyển đổi giữa chế độ suy nghĩ ('thinking') và chế độ tức thì ('instant') để tạo câu trả lời linh hoạt. Kiến trúc MoE giúp mô hình tạo token nhanh hơn trên CPU so với các mô hình dạng dày (dense) truyền thống có cùng tổng số tham số.
## KIẾN THỨC NỀN
Kiến trúc Mixture-of-Experts (MoE) định tuyến từng đầu vào đến một nhóm các mạng con chuyên biệt, giúp giữ số lượng tham số kích hoạt ở mức thấp trong quá trình suy luận. Việc chạy LLM trên CPU dân dụng thường bị nghẽn bởi băng thông RAM, do đó việc giảm tham số kích hoạt trên mỗi token giúp đạt được tốc độ suy luận chấp nhận được mà không cần card đồ họa rời mạnh mẽ.