Cập nhật ExLlamaV3 bổ sung CPU Offload cho MoE và định lượng tự hiệu chỉnh
Nhà phát triển turboderp đã phát hành các bản cập nhật lớn cho ExLlamaV3, giới thiệu tính năng CPU offload cho các chuyên gia Mixture-of-Experts (MoE) và n-gram disk offload cho Qwen-3.8-Flash-Next. Bản cập nhật cũng hỗ trợ mô hình GLM-5.3-Flash cùng một kỹ thuật tối ưu hóa định lượng (quantization) tự hiệu chỉnh mới. Việc chuyển (offload) trọng số chuyên gia MoE sang RAM hệ thống cho phép người dùng chạy các mô hình cực lớn trên GPU phổ thông với VRAM hạn chế. Những cập nhật này mở rộng đáng kể dung lượng và hiệu suất suy luận LLM cục bộ cho cộng đồng AI mã nguồn mở. Bản nâng cấp trình diễn khả năng tối ưu hóa định lượng EXL3 xuống mức 3.05 bit mỗi trọng số (bpw) trên Qwen-3.8-Flash-Next, đáp ứng tốt các tác vụ đòi hỏi độ chính xác cao như tạo mã SVG. Ngoài ra, việc bổ sung disk offload cho n-gram giúp giảm tải hơn nữa bộ nhớ hệ thống trong quá trình sinh văn bản.
## KIẾN THỨC NỀN
ExLlamaV3 là thư viện suy luận mã nguồn mở được tối ưu hóa để chạy các mô hình ngôn ngữ lớn trên GPU NVIDIA phổ thông. Mô hình Mixture-of-Experts (MoE) chia tham số mạng thành các mạng con chuyên biệt ('chuyên gia'), chỉ kích hoạt một tập hợp con cho mỗi token nhưng yêu cầu dung lượng bộ nhớ tổng thể rất lớn. Định lượng (quantization) nén các trọng số mô hình từ độ chính xác cao xuống ít bit hơn (như 3-bit hoặc 4-bit) nhằm giảm đáng kể lượng VRAM tiêu thụ.