~/LLM/tencent-open-sources-compressed-770b-hy4-moe-model-shrinking-footprint-to-214gb

Tencent mở mã nguồn phiên bản nén Hy4 MoE 770B, giảm dung lượng xuống 214GB

Đội ngũ Tencent Hunyuan đã mở mã nguồn phiên bản nén siêu nhẹ cho mô hình Mixture-of-Experts Hy4 preview 770B tham số, giúp thu nhỏ dung lượng trọng số từ gần 1,5TB xuống còn khoảng 214GB. Mô hình sử dụng thuật toán lượng hóa tam phân thưa Sherry cùng chiến lược độ chính xác hỗn hợp MIX-STQ1_0 để cắt giảm mạnh yêu cầu bộ nhớ mà vẫn giữ nguyên năng lực trên các bài kiểm tra. Phát hành này giúp việc vận hành các mô hình MoE khổng lồ trên 700 tỷ tham số trở nên khả thi trên các cấu hình phần cứng phổ thông hoặc tầm trung thay vì phải dùng cụm GPU doanh nghiệp đắt tiền. Ngoài ra, nó chứng minh tính thực tiễn của suy luận liên kết không đồng nhất đa thiết bị, cho phép laptop và GPU máy tính phụ chia sẻ tải MoE dung lượng bit thấp qua mạng nội bộ thông thường. Kỹ thuật nén áp dụng lượng hóa tam phân thưa 1,25-bit Sherry trên các lớp chuyên gia, tự động chọn bit-width từ 1,31-bit (STQ1_0) đến 2,06-bit (IQ2_XXS), duy trì khả năng đọc ngữ cảnh dài gần ngang bản BF16 gốc. Điểm số kiểm tra chỉ giảm nhẹ với MCP Atlas từ 83,7 xuống 83,2 và SWE-Bench multi từ 82,9 xuống 81,3, đồng thời đạt tốc độ 1,02 token/giây khi phân tán giữa một laptop và máy chủ A4000 thông qua prima.cpp.

## KIẾN THỨC NỀN

Lượng hóa (Quantization) giúp giảm dung lượng bộ nhớ của các mô hình ngôn ngữ lớn bằng cách chuyển đổi trọng số số thực độ chính xác cao (như BF16 16-bit) sang các định dạng số bit thấp hơn như 1-bit hay 2-bit. Các mô hình Mixture-of-Experts (MoE) như Hy4 chứa lượng tham số tổng thể rất lớn (770B) nhưng chỉ kích hoạt một phần nhỏ (49B) cho mỗi token, khiến chúng trở thành đối tượng rất thích hợp cho các thuật toán lượng hóa bit thấp.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM#Model Quantization#MoE#Open Source AI#Tencent Hunyuan

$ subscribe --daily

Tencent mở mã nguồn phiên bản nén Hy4 MoE 770B, giảm dung lượng xuống 214GB | Daily News