Phê phán việc dùng LLM để trích xuất bộ nhớ trong các tác nhân AI
Một nhà phát triển đã chỉ trích thói quen phổ biến là sử dụng LLM để lọc, tóm tắt và gắn thẻ bộ nhớ của tác nhân AI, cho rằng điều này tạo ra các lỗi rất khó kiểm tra. Thay vào đó, họ đề xuất một kiến trúc đơn giản và minh bạch hơn bằng cách lưu trữ markdown thô, nhúng vector (embeddings) và truy xuất, được triển khai trong công cụ mã nguồn mở memU. Điều này thách thức một mô hình thiết kế phổ biến trong kiến trúc tác nhân LLM, nêu bật cách các quy trình suy luận nhiều bước có thể làm phức tạp hóa việc gỡ lỗi. Bằng cách chuyển trọng tâm sang lưu trữ thô và truy xuất tốt hơn, các nhà phát triển có thể xây dựng các hệ thống AI dễ dự đoán và kiểm tra hơn. Công cụ được đề xuất, memU, là một hệ thống gọn nhẹ (khoảng 500 dòng mã) được cấp phép Apache-2.0, giúp lập chỉ mục markdown vào cơ sở dữ liệu SQLite cục bộ. Mặc dù phương pháp này tránh được các lỗi trích xuất của LLM, nhưng nó phụ thuộc rất nhiều vào chất lượng của mô hình nhúng (embedding model) để xử lý văn bản thô chưa được tóm tắt.
## KIẾN THỨC NỀN
Các tác nhân AI (AI agents) thường cần bộ nhớ để duy trì ngữ cảnh qua nhiều lượt tương tác hoặc phiên làm việc khác nhau. Một kiến trúc phổ biến là sử dụng một LLM để xử lý các lượt hội thoại đầu vào, quyết định thông tin nào quan trọng cần lưu và tóm tắt lại trước khi đưa vào cơ sở dữ liệu vector để truy xuất sau này.