IFM Phát Hành Mô Hình GGUF K2-Horizon-MoVA-36B-A4B Với Cửa Sổ Ngữ Cảnh 512K
IFM đã phát hành các bản lượng hóa GGUF cho K2-Horizon-MoVA-36B-A4B, một mô hình Mixture-of-Experts (MoE) dạng thưa sở hữu tổng cộng 36B tham số nhưng chỉ kích hoạt 4B tham số trên mỗi token. Mô hình hỗ trợ cửa sổ ngữ cảnh nguyên bản 512K token và được phát hành cùng các biến thể GGUF nhỏ hơn từ 0,9B đến 32B tham số. Nhờ đạt hiệu suất suy luận cạnh tranh trong khi chỉ kích hoạt 4B tham số, mô hình mang lại hiệu quả tính toán cao cho việc chạy các mô hình ngữ cảnh lớn trên thiết bị cục bộ. Ngoài ra, việc IFM kế hoạch phát hành dữ liệu huấn luyện, mã nguồn và các checkpoint trung gian sẽ hỗ trợ tích cực cho nghiên cứu AI mở và khả năng tái lập. Kiến trúc này tích hợp cơ chế Mixture-of-Values Attention (MoVA) và hỗ trợ độ dài ngữ cảnh nguyên bản 524.288 token được thiết lập từ giai đoạn giữa của quá trình huấn luyện. Định dạng GGUF cho phép triển khai và suy luận hiệu quả trên phần cứng người dùng thông qua các trình chạy như llama.cpp.
## KIẾN THỨC NỀN
Mixture-of-Experts (MoE) là thiết kế mô hình giúp định tuyến các token đầu vào đến các mạng con chuyên gia cụ thể, cho phép mở rộng tổng dung lượng tham số nhưng giữ mức tính toán kích hoạt trên mỗi token ở mức thấp. GGUF là định dạng tệp nhị phân chuẩn hóa được tạo cho llama.cpp, cho phép suy luận LLM đã lượng hóa một cách nhanh chóng và tiết kiệm bộ nhớ trên CPU lẫn GPU.