~/LLMS/hugging-face-research-spotlight-deepseek-kv-cache-compression-and-ai-agent-harnesses

Điểm tin nghiên cứu Hugging Face: Nén KV Cache của DeepSeek và tối ưu hóa AI Agent Harness

Một bài viết phổ biến trên Reddit đã tổng hợp ba bài báo nghiên cứu nổi bật từ Hugging Face Daily Papers tập trung vào nén KV cache và tối ưu hóa AI agent harness. Các công trình nổi bật bao gồm DeepSeek-V4.1-Flash đạt mức giảm dung lượng bộ nhớ đáng kể nhờ tái sử dụng KV qua các lớp kết hợp định lượng FP4, cùng với hai nghiên cứu phân tích hiệu quả của agent harness. Dung lượng bộ nhớ và quản lý ngữ cảnh vẫn là những điểm nghẽn lớn khi triển khai các LLM ngữ cảnh dài và vận hành AI agent đa bước một cách tiết kiệm chi phí. Những đột phá về nén KV cache 4-bit và thiết kế harness tự động giúp giảm trực tiếp yêu cầu bộ nhớ suy luận và giảm lượng token tiêu thụ trong các hệ thống thực tế. DeepSeek-V4.1-Flash kết hợp chia sẻ KV qua các lớp với nén KV cache FP4 để thu gọn dung lượng KV cache toàn cục xuống còn 890 byte cho mỗi token, chỉ bằng khoảng một phần tư so với DeepSeek-V4-Flash. Bên cạnh đó, nghiên cứu SoL-Pi giới thiệu vòng lặp nghiên cứu tự động giúp tối ưu hóa môi trường thực thi của agent, giảm từ 44.7% đến 49.0% lượng token sử dụng mà vẫn duy trì hiệu suất mục tiêu.

## KIẾN THỨC NỀN

Agent harness là khung hạ tầng phần mềm bao bọc quanh LLM nhằm quản lý bộ nhớ, công cụ, trạng thái thực thi và vòng phản hồi để mô hình có thể thực hiện các hành động đa bước. Trong khi đó, KV (Key-Value) cache lưu trữ các trạng thái key và value trong quá trình suy luận Transformer để tránh tính toán lại các token cũ, nhưng dung lượng bộ nhớ của nó tăng trưởng tuyến tính theo độ dài ngữ cảnh và số lượng lớp của mô hình.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLMs#KV Cache#AI Agents#DeepSeek#AI Research

$ subscribe --daily

Điểm tin nghiên cứu Hugging Face: Nén KV Cache của DeepSeek và tối ưu hóa AI Agent Harness | Daily News