~/LOCAL LLMS/ling-3-0-tiny-delivers-high-performance-on-low-end-pcs-using

Ling 3.0 Tiny mang lại hiệu năng cao trên PC cấu hình thấp nhờ kiến trúc MoE

Một người dùng báo cáo rằng mô hình Ling 3.0 Tiny, một mô hình Mixture-of-Experts (MoE) của InclusionAI, đã đạt tốc độ suy luận cao lên tới 36 token/giây trên một máy tính cấu hình thấp chỉ có 4GB VRAM. Mô hình này có tổng cộng 7,9 tỷ tham số nhưng chỉ kích hoạt 1,3 tỷ tham số cho mỗi token, giúp tối ưu hóa tốc độ chạy cục bộ. Điều này chứng minh tính khả thi trong thực tế của việc chạy các mô hình Mixture-of-Experts (MoE) có năng lực tốt trên phần cứng phổ thông bị giới hạn tài nguyên. Nó làm nổi bật xu hướng phát triển các mô hình thưa (sparse models) hiệu quả cao giúp giảm rào cản tiếp cận cho việc triển khai AI cục bộ. Ling 3.0 Tiny sở hữu cửa sổ ngữ cảnh lớn lên tới 262.144 token và được thiết kế cho các tác vụ suy luận cục bộ, lập trình và tác nhân AI. Người dùng lưu ý rằng độ thông minh của nó tương đương với các mô hình dày đặc (dense models) lớn hơn như Qwen 3.5 9B và Gemma 12, nhưng chạy nhanh hơn đáng kể nhờ số lượng tham số kích hoạt thấp.

## KIẾN THỨC NỀN

Mixture-of-Experts (MoE) là một kiến trúc mạng thần kinh giúp giảm chi phí tính toán bằng cách định tuyến dữ liệu đầu vào đến các mạng con cụ thể, hay còn gọi là 'chuyên gia' (experts), thay vì kích hoạt toàn bộ mô hình. Điều này cho phép mô hình có dung lượng lớn (tổng số tham số) trong khi vẫn duy trì mức tiêu thụ tài nguyên tính toán của một mô hình nhỏ hơn nhiều (tham số kích hoạt) trong quá trình suy luận.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Local LLMs#Edge AI#Mixture of Experts#Hardware Benchmarks

$ subscribe --daily

Ling 3.0 Tiny mang lại hiệu năng cao trên PC cấu hình thấp nhờ kiến trúc MoE | Daily News