Vòng lặp Agent vượt trội hơn hẳn các Pipeline RAG truyền thống trên Benchmark Google FRAMES
Các nhà phát triển đã đánh giá 18 biến thể pipeline RAG (Retrieval-Augmented Generation) truyền thống so với một vòng lặp agent trên 824 câu hỏi đa bước (multi-hop) thuộc bộ dữ liệu FRAMES của Google. Vòng lặp truy xuất dạng agent đã đạt độ chính xác 92,7%, vượt xa biến thể pipeline truyền thống tốt nhất vốn chỉ đạt 78,9%. Kết quả cho thấy các vòng lặp agent động, nhiều bước hiệu quả hơn nhiều so với các tối ưu hóa pipeline tĩnh như mở rộng truy vấn hay sắp xếp lại thứ tự (reranking) đối với các tác vụ suy luận phức tạp. Điều này nhấn mạnh sự chuyển dịch kỹ thuật hướng tới kiến trúc dạng agent cho các hệ thống tìm kiếm và hỏi đáp thông tin doanh nghiệp. Bất ngờ thay, việc thêm một reranker nhỏ đã làm giảm 9 điểm phần trăm độ chính xác của pipeline tốt nhất, trong khi reranker lớn hơn mang lại cải thiện không đáng kể. Ngoài ra, thử nghiệm cho thấy các mô hình thường trả lời bằng bộ nhớ nội tại bất chấp hướng dẫn nghiêm ngặt chỉ dựa vào ngữ cảnh truy xuất, đòi hỏi phải xác minh thủ công tất cả các câu trả lời đúng.
## KIẾN THỨC NỀN
RAG truyền thống phụ thuộc vào pipeline một bước tĩnh—nhúng câu lệnh, truy xuất các đoạn tài liệu phù hợp và tạo câu trả lời—vốn gặp khó khăn với suy luận đa bước (multi-hop) khi cần tổng hợp thông tin từ nhiều nguồn khác nhau. Bộ dữ liệu benchmark FRAMES của Google kiểm tra khả năng truy xuất và suy luận toàn diện trên 2 đến 15 bài viết Wikipedia. Agentic RAG thay thế các pipeline tĩnh bằng một vòng lặp suy luận, trong đó LLM đánh giá linh hoạt kết quả truy xuất và đưa ra các truy vấn tìm kiếm bổ sung khi cần.