~/LLM QUANTIZA/ista-daslab-releases-gsq-and-rco-optimized-ggufs-for-qwen3-8-flash

ISTA-DASLab Phát Hành Phiên Bản GGUF Tối Ưu GSQ và RCO Cho Qwen3.8-Flash-Next

ISTA-DASLab đã phát hành các trọng số GGUF định lượng cho mô hình MoE Qwen3.8-Flash-Next 176,9B tham số bằng cách sử dụng các kỹ thuật lượng hóa GSQ và tối ưu hóa RCO mới. Bản phát hành bao gồm các tệp GGUF lượng hóa tiêu chuẩn từ 2,40 đến 3,50 bpw cùng một biến thể Coder đã cắt giảm 50% số lượng expert để đạt mức dung lượng trung bình hiệu dụng chỉ ~1,89 bpw. Phát triển này cho phép chạy một mô hình khổng lồ 176,9B tham số (vốn yêu cầu 354 GB bộ nhớ ở định dạng BF16) trên một bộ tăng tốc 32 GB duy nhất nhờ giảm dung lượng bộ nhớ thường trực xuống 29,6 GB. Điều này chứng minh rằng việc kết hợp lượng hóa sau huấn luyện nâng cao với cắt giảm expert có mục tiêu có thể giảm mạnh yêu cầu phần cứng mà vẫn giữ được trên 98% hiệu năng lập trình. GSQ sử dụng nới lỏng Gumbel-Softmax để lượng hóa vô hướng sau huấn luyện tương thích với định dạng GGUF chuẩn, trong khi RCO áp dụng tối ưu hóa ràng buộc Riemannian để phân bổ ngân sách bit chính xác cho từng tensor và chọn lọc các expert cần giữ lại. Biến thể Coder bị cắt giảm 50% expert loại bỏ 256 trên 512 expert mỗi lớp nhưng giữ nguyên các trọng số còn lại ở 3,5 bpw, đạt điểm số 75,60 trên SWE-bench Verified (giữ 91,3% hiệu năng so với bản BF16 gốc).

## KIẾN THỨC NỀN

Các mô hình ngôn ngữ lớn Mixture-of-Experts (MoE) phân bổ tham số vào các mạng con chuyên biệt gọi là các expert, chỉ kích hoạt một phần nhỏ expert cho mỗi token để duy trì dung lượng lớn với chi phí tính toán vừa phải. Lượng hóa (quantization) nén mô hình bằng cách lưu trữ trọng số với ít bit hơn trên mỗi tham số, trong khi GGUF là định dạng tệp nhị phân phổ biến được sử dụng bởi các công cụ chạy mô hình cục bộ như llama.cpp.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM Quantization#MoE#Model Pruning#Qwen#Local AI

$ subscribe --daily