Báo cáo lượng tử hóa mô hình LFM2.5-2.6B của LiquidAI hé lộ sự sụt giảm hiệu năng đột ngột
Một báo cáo lượng tử hóa thực nghiệm cho mô hình LFM2.5-2.6B của LiquidAI tiết lộ rằng sự suy giảm chất lượng diễn ra đột ngột như một vách đá thay vì một đường cong mượt mà khi kết hợp lượng tử hóa mô hình và KV cache. Phân tích cho thấy mô hình có thể chạy trên Raspberry Pi 8GB mà không bị suy giảm chất lượng đáng kể, nhưng cảnh báo không nên sử dụng định dạng lượng tử hóa Q4_K_M. Báo cáo này cung cấp những thông tin thực tiễn giá trị cho việc triển khai các mô hình hiệu quả cao trên các thiết bị biên như Raspberry Pi, làm nổi bật sự đánh đổi giữa trọng số mô hình và lượng tử hóa KV cache. Nó cũng thách thức các chỉ số đánh giá tiêu chuẩn như KLD logarithmic, vốn có thể che giấu sự sụt giảm đột ngột về chất lượng mô hình. Báo cáo lưu ý rằng chất lượng lượng tử hóa mô hình suy giảm nhanh hơn lượng tử hóa KV cache đối với mô hình cụ thể này, và việc áp dụng abliteration sẽ tốn một chi phí cố định khoảng 0.075 KLD. Các chỉ số tiêu chuẩn như biểu đồ Top-1% và Logarithmic KLD bị chỉ trích vì mô tả sai lệch rằng sự suy giảm diễn ra mượt mà.
## KIẾN THỨC NỀN
Liquid Foundation Models (LFM) là một thế hệ mô hình AI tạo sinh mới do Liquid AI thiết kế nhằm tối ưu hóa việc triển khai trên thiết bị và thiết bị biên. Lượng tử hóa (quantization) là kỹ thuật giảm độ chính xác của trọng số mô hình và bộ nhớ đệm Key-Value (KV cache) để tiết kiệm bộ nhớ, trong khi abliteration là phương pháp được sử dụng để loại bỏ bộ lọc kiểm duyệt của LLM mà không cần huấn luyện lại hoàn toàn.