Cộng đồng LocalLLaMA thảo luận về các trường hợp sử dụng K2 Horizon MoVA 36B-A4B
Các thành viên trên cộng đồng r/LocalLLaMA đang tìm kiếm phản hồi thực tế và kịch bản triển khai cho K2-Horizon-MoVA-36B-A4B, một mô hình Mixture-of-Experts mở mới phát hành. Được phát triển bởi Viện Mô hình Nền tảng (IFM), mô hình này có tổng cộng 36 tỷ tham số nhưng chỉ kích hoạt 4 tỷ tham số cho mỗi token. Kiến trúc Mixture-of-Experts (MoE) thưa cho phép người dùng cá nhân chạy các mô hình dung lượng lớn với chi phí tính toán khi suy luận thấp hơn đáng kể. Phản hồi từ cộng đồng giúp các nhà phát triển nguồn mở đánh giá liệu K2 Horizon MoVA có ưu thế thực tế so với các mô hình dày (dense) truyền thống trên phần cứng phổ thông hay không. K2 Horizon MoVA 36B-A4B đạt hiệu năng gần tương đương với mô hình Horizon 32B dày nhưng sử dụng ít tham số kích hoạt hơn đáng kể và hỗ trợ ngữ cảnh tự nhiên lên tới 512K token. Phát hành theo giấy phép Apache-2.0, mô hình hỗ trợ ngay từ đầu cho các công cụ suy luận phổ biến như vLLM, SGLang và Ollama.
## KIẾN THỨC NỀN
Mixture of Experts (MoE) là một kiến trúc định tuyến các token đến các mạng con chuyên biệt, giúp giảm chi phí tính toán trên mỗi token so với các mô hình dày kích hoạt toàn bộ tham số. Bộ sưu tập K2 Horizon của IFM là một bộ mô hình mở hoàn toàn, cung cấp đầy đủ trọng số, mã huấn luyện và tập dữ liệu. Bằng cách dùng định tuyến thưa, 36B-A4B hướng tới việc mang lại đầu ra chất lượng cao trong khi vẫn giữ yêu cầu băng thông bộ nhớ phù hợp với phần cứng cá nhân.