~/LLM/bytedance-seed-team-discovers-phase-sensitivity-causing-long-context-performance-drift-in

Đội ngũ Seed của ByteDance phát hiện độ nhạy pha gây suy giảm hiệu năng ngữ cảnh dài ở LLM

Đội ngũ Seed của ByteDance đã công bố nghiên cứu trên arXiv chỉ ra rằng việc nén KV cache theo khối (chunked KV cache compression) gây ra hiện tượng "độ nhạy pha" (phase sensitivity) trong các LLM ngữ cảnh dài như DeepSeek. Hiện tượng này tạo ra các điểm yếu theo chu kỳ dựa trên sự căn chỉnh token trong ranh giới cửa sổ nén, khiến độ chính xác truy xuất thông tin biến động lên tới 40 điểm phần trăm. Mặc dù nén KV cache theo khối giúp giảm mạnh chi phí bộ nhớ và tính toán cho đầu vào dài, độ nhạy pha cho thấy các điểm số đánh giá trung bình truyền thống có thể che giấu những thất bại truy xuất nghiêm trọng. Phát hiện này rất quan trọng để xây dựng các kỹ thuật nén bộ nhớ tin cậy hơn và các tiêu chuẩn đánh giá thực tế cho mô hình ngữ cảnh dài. Các nhà nghiên cứu đã đánh giá nhiều biến thể mô hình DeepSeek gốc và sau huấn luyện, ghi nhận sự bất đối xứng có hệ thống khi cùng một thông tin lại dễ truy xuất ở vị trí pha này nhưng khó hơn nhiều ở vị trí pha khác. Điều này xác nhận rằng pha tương đối của token bên trong cửa sổ nén đóng vai trò như một tọa độ vị trí ngoài ý muốn ảnh hưởng đến khả năng gợi nhớ.

## KIẾN THỨC NỀN

Trong các mô hình ngôn ngữ lớn dựa trên Transformer, KV cache lưu trữ các tensor key và value từ các token trước đó để mô hình không phải tính toán lại trong quá trình tạo văn bản từng bước. Tuy nhiên, xử lý ngữ cảnh dài đòi hỏi dung lượng bộ nhớ khổng lồ để lưu các tensor này, thúc đẩy các nhà nghiên cứu sử dụng kỹ thuật nén theo khối nhằm gộp các cửa sổ token liên tiếp thành ít thẻ bộ nhớ hơn.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM#DeepSeek#KV Cache#Long Context#AI Research

$ subscribe --daily

Đội ngũ Seed của ByteDance phát hiện độ nhạy pha gây suy giảm hiệu năng ngữ cảnh dài ở LLM | Daily News