Giảm 100 lần dung lượng ngữ cảnh của AI Agent bằng Kimi K3 và mô-đun bộ nhớ của Microsoft
Một phương pháp mới kết hợp mô hình AI Kimi K3 với mô-đun bộ nhớ do Microsoft phát triển giúp giảm tới 100 lần dung lượng ngữ cảnh của AI agent. Cách tiếp cận này giúp duy trì tính mạch lạc và ngữ cảnh của cuộc hội thoại dài hạn trong các tương tác hoặc tác vụ phát triển kéo dài. Các mô hình ngôn ngữ lớn thường gặp phải chi phí token cao và độ trễ lớn khi xử lý lịch sử hội thoại dài. Bằng cách giảm đáng kể kích thước ngữ cảnh trong khi vẫn bảo toàn tính mạch lạc, sự kết hợp này giúp các quy trình làm việc tự động (agentic workflows) và tác vụ lập trình dài hạn trở nên hiệu quả và tiết kiệm chi phí hơn nhiều. Công nghệ cốt lõi nhiều khả năng tận dụng PlugMem của Microsoft, giúp chuyển đổi lịch sử tương tác thô, giá trị thấp thành kiến thức có cấu trúc và có thể tái sử dụng. Kimi K3, một mô hình 2,8 nghìn tỷ tham số với cửa sổ ngữ cảnh 1 triệu token, được hưởng lợi từ việc này bằng cách tránh phình to token trong các tác vụ phức tạp, nhiều bước.
## KIẾN THỨC NỀN
Các AI agent phụ thuộc vào cửa sổ ngữ cảnh để ghi nhớ các tương tác trước đó, nhưng việc lưu trữ lịch sử trò chuyện thô sẽ nhanh chóng tiêu tốn token bộ nhớ và làm giảm hiệu suất. Kimi K3 là một mô hình AI quy mô lớn được thiết kế cho các tác vụ lập trình và xử lý tri thức phức tạp. Microsoft Research gần đây đã giới thiệu PlugMem, một mô-đun bộ nhớ đa dụng được thiết kế để tối ưu hóa cách các agent lưu trữ và truy xuất lịch sử tương tác dài hạn.