~/MACHINE LEAR/littlebit-ultra-low-bit-quantization-via-latent-factorization-for-llms

LittleBit: Lượng tử hóa cực thấp cho LLM thông qua phân tích nhân tử ẩn

Các nhà nghiên cứu đã giới thiệu LittleBit, một phương pháp huấn luyện nhận biết lượng tử hóa (QAT) mới giúp nén các mô hình ngôn ngữ lớn xuống chỉ còn 0,1 bit mỗi trọng số. Kỹ thuật này sử dụng phân tích nhân tử ma trận ẩn lấy cảm hứng từ SVD để nhị phân hóa các nhân tử ma trận, giảm kích thước mô hình Llama2-13B xuống dưới 0,9 GB, tương đương với mức giảm bộ nhớ khoảng 31 lần. Việc lượng tử hóa mức bit cực thấp giúp triển khai các mô hình ngôn ngữ 13 tỷ tham số trên các thiết bị cá nhân có dung lượng RAM và VRAM cực kỳ hạn chế. Điều này làm giảm đáng kể rào cản triển khai các mô hình AI cục bộ hiệu quả và bảo mật trên thiết bị biên. Để bù đắp sự mất mát thông tin nghiêm trọng từ việc nhị phân hóa các nhân tử ma trận cấp thấp, LittleBit tích hợp một cơ chế bù đa tỷ lệ trên các chiều hàng, cột và chiều ẩn để học độ quan trọng theo từng hạng. Phương pháp kết hợp này cho phép mô hình duy trì độ chính xác hoạt động ngay cả ở mức bit cực thấp.

## KIẾN THỨC NỀN

Lượng tử hóa mô hình giúp giảm dung lượng bộ nhớ bằng cách lưu trữ trọng số của mạng nơ-ron số thực phẩy động dưới dạng các định dạng có độ chính xác thấp hơn. Huấn luyện nhận biết lượng tử hóa (QAT) mô phỏng những tổn thất độ chính xác này trong quá trình huấn luyện, cho phép các trọng số của mô hình tự điều chỉnh động và giữ lại hiệu suất tốt hơn nhiều so với lượng tử hóa sau huấn luyện.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Machine Learning#Quantization#LLMs#Model Compression#AI Research

$ subscribe --daily

LittleBit: Lượng tử hóa cực thấp cho LLM thông qua phân tích nhân tử ẩn | Daily News