Mô hình MoE G9v3-39A5B đạt điểm benchmark ấn tượng và được hỗ trợ trên llama.cpp
Một mô hình ngôn ngữ Mixture of Experts (MoE) mới mang tên G9v3-39A5B của ai9stars vừa xuất hiện, đạt kết quả benchmark ấn tượng trên Artificial Analysis. Bên cạnh đó, các nhà phát triển đang tích cực tích hợp hỗ trợ cho mô hình này vào thư viện suy luận llama.cpp. Hiệu suất benchmark của mô hình này được báo cáo là vượt qua một số mô hình tên tuổi như Qwen 27B, biến nó thành một lựa chọn mã nguồn mở đầy cạnh tranh. Việc tích hợp với llama.cpp sẽ cho phép người dùng chạy mô hình MoE mạnh mẽ này cục bộ trên phần cứng phổ thông. Một nhánh tùy chỉnh của llama.cpp đã được nhà phát triển linuxid10t tạo ra để hỗ trợ G9v3, cho phép người dùng thử nghiệm các phiên bản GGUF và BF16. Tuy nhiên, vì đây là một bản phát hành tương đối mới, việc thử nghiệm toàn diện từ cộng đồng và hỗ trợ chính thức trên nhánh chính vẫn đang được chờ đợi.
## KIẾN THỨC NỀN
Mixture of Experts (MoE) là một kiến trúc AI định tuyến các truy vấn đến các phân mạng 'chuyên gia' cụ thể, chỉ kích hoạt một phần nhỏ trong tổng số tham số cho mỗi token để tiết kiệm tài nguyên tính toán. llama.cpp là một thư viện C/C++ mã nguồn mở phổ biến được thiết kế để suy luận LLM cục bộ hiệu quả trên phần cứng tiêu dùng.