Chạy ngữ cảnh 1 triệu token trên VRAM 24GB bằng lượng tử hóa KVarN
Một người dùng đã chạy thành công cửa sổ ngữ cảnh 1 triệu token trên một GPU RTX 3090 24GB duy nhất bằng mô hình 35B (Qwen 3.5 35B A3B). Thành tựu này đạt được nhờ áp dụng phương pháp lượng tử hóa KV-Cache chuẩn hóa phương sai 4-bit (KVarN) trong một bản fork tùy chỉnh của llama.cpp có tên là BeeLlama.cpp. Cột mốc này chứng minh rằng phần cứng cấp tiêu dùng có thể xử lý các độ dài ngữ cảnh khổng lồ mà không làm mất đi độ chính xác khi truy xuất, giúp các ứng dụng LLM ngữ cảnh dài trở nên dễ tiếp cận hơn nhiều. Nó làm nổi bật KVarN như một giải pháp thay thế vượt trội cho lượng tử hóa KV-Cache 4-bit tiêu chuẩn, vốn thường bị giảm độ chính xác nghiêm trọng ở ngữ cảnh dài. Mô hình 35B chiếm 17 GB VRAM, để lại không gian hạn chế cho KV-Cache, vốn đã được nén bằng KVarN. Cấu hình này đã vượt qua thử nghiệm "needle-in-a-haystack" bằng cách truy xuất thành công 7 thông tin khác nhau được đặt rải rác trong văn bản 1 triệu token.
## KIẾN THỨC NỀN
KV-Cache (Bộ nhớ đệm Key-Value) lưu trữ các trạng thái key-value trước đó để tránh tính toán lặp lại trong quá trình tạo văn bản của LLM, nhưng nó tăng tuyến tính theo độ dài ngữ cảnh và tiêu tốn lượng VRAM khổng lồ. KVarN (Lượng tử hóa KV-Cache chuẩn hóa phương sai) là một kỹ thuật do Huawei phát triển, áp dụng phép quay Hadamard và chuẩn hóa phương sai tỷ lệ kép để nén bộ nhớ đệm xuống 4-bit trong khi giảm thiểu sự tích tụ sai số. Thử nghiệm "Needle in a Haystack" đánh giá khả năng của LLM trong việc truy xuất thông tin cụ thể được nhúng sâu bên trong một văn bản lớn.