~/LLM/jetbrains-releases-gguf-quantization-weights-for-mellum-2-1-moe-model

JetBrains phát hành trọng số định dạng GGUF cho mô hình MoE Mellum 2.1

JetBrains đã phát hành các trọng số định lượng theo định dạng GGUF cho Mellum 2.1, một mô hình ngôn ngữ suy luận nhỏ dạng Mixture-of-Experts (MoE). Mô hình này sở hữu tổng cộng 12 tỷ tham số nhưng chỉ kích hoạt 2,5 tỷ tham số cho mỗi token trong quá trình suy luận. Đợt phát hành này cho thấy các công ty sản xuất công cụ phần mềm lớn đang đóng góp các mô hình trọng số mở được tối ưu cho việc chạy cục bộ, nhẹ nhàng. Việc có một mô hình suy luận chỉ với 2,5 tỷ tham số kích hoạt giúp việc chạy các trợ lý AI cục bộ chất lượng cao trở nên dễ tiếp cận hơn trên phần cứng cá nhân. Mô hình được cung cấp dưới định dạng nhị phân GGUF, tương thích với các công cụ chạy LLM cục bộ phổ biến như llama.cpp và Ollama. Dù được mô tả là một mô hình suy luận ("thinking"), các chỉ số kiểm thử kỹ thuật chi tiết và phương pháp tinh chỉnh vẫn chưa được bao gồm trong thông báo ban đầu.

## KIẾN THỨC NỀN

Kiến trúc Mixture-of-Experts (MoE) chia một mô hình ngôn ngữ thành các mạng con chuyên biệt, điều hướng từng token đầu vào chỉ đến một phần nhỏ trong tổng số tham số nhằm giảm chi phí tính toán. GGUF là định dạng tệp chuẩn được thiết kế để lưu trữ LLM định lượng hiệu quả và suy luận nhanh trên CPU và GPU thông thường. JetBrains, được biết đến rộng rãi với các IDE lập trình như IntelliJ IDEA, đang tiếp tục mở rộng các bộ công cụ AI mở dành cho nhà phát triển.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM#Mixture of Experts#JetBrains#Open Source AI#LocalAI

$ subscribe --daily

JetBrains phát hành trọng số định dạng GGUF cho mô hình MoE Mellum 2.1 | Daily News