Phát hành hai mô hình trọng số mở Victoria và Maple
Các nhà nghiên cứu đã phát hành hai mô hình LLM trọng số mở được tinh chỉnh: Victoria, mô hình lập trình đại lý được cắt giảm 44% số lượng chuyên gia (experts) từ Qwen3.8-Flash-Next, và Maple, mô hình được tối ưu hóa riêng cho các truy vấn về quy định và dịch vụ công tại Canada. Victoria được huấn luyện lại trực tiếp ở định dạng 4-bit NVFP4, đạt 70,0% điểm trên benchmark Terminal-Bench 2.1 cùng tốc độ suy luận cao. Đợt phát hành này cho thấy việc kết hợp giữa cắt tỉa chuyên gia (expert pruning) và huấn luyện nhận biết lượng hóa có thể giảm mạnh dung lượng bộ nhớ của LLM mà vẫn giữ được độ chính xác khi thực thi. Ngoài ra, mô hình Maple cũng minh họa cách tinh chỉnh theo khu vực để khắc phục định kiến mặc định hướng về Mỹ của các mô hình nền tảng. Victoria sử dụng phương pháp REAP để cắt giảm chuyên gia từ 512 xuống 288 ở mỗi lớp, đạt tốc độ 280 token/giây trên phần cứng Dell B300 nhờ đầu dự đoán (draft head) hỗ trợ giải mã suy đoán (speculative decoding). Trong khi đó, Maple đã cải thiện tỷ lệ trả lời đúng hoàn toàn cho các câu hỏi về Canada từ 6,6% lên 21,8% và nâng tỷ lệ trích dẫn nguồn chính thống lên 62,9%.
## KIẾN THỨC NỀN
Kiến trúc Mixture-of-Experts (MoE) định tuyến dữ liệu đầu vào đến các mạng con chuyên biệt (experts), giúp mở rộng quy mô tham số nhưng lại đòi hỏi dung lượng bộ nhớ rất lớn. Kỹ thuật REAP (Router-weighted Expert Activation Pruning) giúp nén mô hình MoE bằng cách loại bỏ các chuyên gia ít đóng góp dựa trên trọng số định tuyến và chuẩn kích hoạt. Trong khi đó, NVFP4 là định dạng số thực dấu phẩy động 4-bit của NVIDIA giúp tối ưu hóa băng thông suy luận và hiệu năng trên phần cứng thế hệ mới.