Tencent nén mô hình Hy4-preview từ 1,5TB xuống còn 200GB GGUF nhưng vẫn giữ 98% hiệu năng
Tencent đã nén thành công mô hình thế hệ mới Hy4-preview từ dung lượng khổng lồ 1,5TB xuống còn khoảng 200GB ở định dạng GGUF. Bất chấp sự sụt giảm mạnh về kích thước này, mô hình sau khi nén vẫn giữ được khoảng 98% hiệu năng ban đầu. Việc nén này giúp giảm đáng kể rào cản phần cứng, cho phép chạy một mô hình ngôn ngữ lớn hàng đầu trên các thiết bị của người dùng cá nhân hoặc bán chuyên thay vì yêu cầu các cụm GPU cấp doanh nghiệp. Điều này thúc đẩy khả năng tiếp cận việc triển khai AI cục bộ cho các mô hình tiên tiến. Hy4-preview là một mô hình hỗn hợp chuyên gia (MoE) sở hữu tổng cộng 770 tỷ tham số, với 49 tỷ tham số hoạt động và cửa sổ ngữ cảnh vượt quá 1 triệu token. Việc chuyển đổi sang định dạng GGUF cho phép suy luận hiệu quả và tải nhanh trên các hệ thống cục bộ.
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ lớn (LLM) thường yêu cầu lượng VRAM khổng lồ để hoạt động vì trọng số của chúng được lưu trữ ở định dạng độ chính xác cao như FP16. Lượng tử hóa (quantization) là một kỹ thuật chuyển đổi các trọng số này sang định dạng độ chính xác thấp hơn, giúp giảm đáng kể dung lượng bộ nhớ của mô hình. GGUF là một định dạng tệp nhị phân phổ biến được thiết kế bởi cộng đồng llama.cpp nhằm tối ưu hóa việc tải và thực thi các mô hình lượng tử hóa này trên phần cứng của người tiêu dùng.