Người dùng Reddit khen ngợi nhà nén mô hình Mradermacher vì tốc độ suy luận Gemma local nhanh chóng
Một thành viên trong cộng đồng LocalLLaMA đã chia sẻ về hiệu năng cục bộ vượt trội khi dùng phiên bản Gemma 26B nén do mradermacher (nhà đăng tải phổ biến trên Hugging Face) cung cấp. Người dùng đạt tốc độ suy luận 75 token/giây cho việc tạo văn bản và 1.500 token/giây cho việc xử lý đầu vào trên hệ thống sử dụng hai GPU Nvidia RTX 4060. Điều này thể hiện các phương pháp lượng hóa ma trận tầm quan trọng (IQ) hiện đại cho phép người dùng chạy các mô hình lớn khoảng 26 tỷ tham số trên phần cứng tiêu dùng giá rẻ. Nó cũng nhấn mạnh vai trò quan trọng của các nhà nén mô hình trong cộng đồng trong việc giúp AI mã nguồn mở trở nên dễ tiếp cận và đạt hiệu năng cao. Cấu hình này sử dụng hai GPU RTX 4060 8GB (tổng cộng 16GB VRAM) chạy các mô hình được lượng hóa bằng IQ quant thông qua LM Studio. Kết quả phân biệt rõ giữa xử lý đầu vào (prefill) đạt khả năng song song hóa cao với 1.500 tok/s và giai đoạn tạo token nối tiếp (decode) đạt 75 tok/s.
## KIẾN THỨC NỀN
Lượng hóa (Quantization) làm giảm độ chính xác của các trọng số LLM (ví dụ từ 16-bit xuống 2-bit hoặc 4-bit) nhằm giảm dung lượng bộ nhớ và tăng tốc độ xử lý, trong đó kỹ thuật lượng hóa IQ tận dụng ma trận tầm quan trọng để giữ chất lượng mô hình cao ở mức dung lượng nhỏ. Suy luận LLM gồm giai đoạn xử lý đầu vào (đọc dữ liệu vào song song) và giai đoạn tạo token (tạo văn bản đầu ra tuần tự).