~/LLM BENCHMAR/echonet-benchmark-tests-9-open-llms-on-spotting-misinformation-in-agentic-search

Thử nghiệm EchoNet đánh giá khả năng phát hiện thông tin sai lệch của 9 LLM mở trọng số

Một nhà phát triển đã giới thiệu EchoNet, một công cụ đánh giá (benchmark) mới được thiết kế để kiểm tra cách chín mô hình ngôn ngữ lớn (LLM) mở trọng số xử lý thông tin sai lệch, thao túng thứ hạng tìm kiếm và các nguồn mâu thuẫn trong các tác vụ tìm kiếm tự trị (agentic search). Công cụ này đo lường cụ thể khả năng "phân xử nhận thức" (epistemic arbitration), tức là cách các mô hình quyết định tin vào tri thức nội tại sẵn có hay các kết quả tìm kiếm mới từ bên ngoài. Khi các tác nhân AI ngày càng thực hiện nhiều tìm kiếm web để trả lời câu hỏi, việc hiểu cách chúng phân xử giữa các dữ liệu mâu thuẫn là rất quan trọng để ngăn chặn việc lan truyền rác SEO hoặc thông tin sai lệch có tổ chức. Thử nghiệm này tiết lộ rằng các mô hình rất dễ bị tổn thương trước một "đa số giả tạo nhưng ồn ào" phủ nhận một nguồn đáng tin cậy duy nhất, làm nổi bật điểm yếu cốt lõi trong các hệ thống Tạo truy xuất tăng cường (RAG) hiện nay. Các mô hình GLM 5.2 và Qwen3.8 chưa từng bị đánh lừa bởi các trang web giả mạo, trong đó GLM 5.2 đạt Điểm Phân xử Nhận thức (EAS) tổng thể cao nhất. Mặc dù các mô hình dễ dàng phát hiện ra những lời nói dối đơn lẻ, việc bao vây một nguồn tin thật bằng nhiều trang giả mạo cùng tuyên bố một thông tin sai lệch đã làm giảm độ chính xác trung bình đi 22 điểm.

## KIẾN THỨC NỀN

Tìm kiếm tự trị (agentic search) đề cập đến việc các tác nhân AI tự động phân tách các truy vấn, tìm kiếm trên web và tổng hợp câu trả lời. Trong kỹ thuật Tạo truy xuất tăng cường (RAG), các LLM thường phải đối mặt với sự "phân xử nhận thức" (epistemic arbitration), nơi chúng phải giải quyết các xung đột giữa bộ nhớ nội tại đã được huấn luyện trước và thông tin bên ngoài có thể không đáng tin cậy hoặc lỗi thời được truy xuất trong quá trình tìm kiếm.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM Benchmarking#Retrieval-Augmented Generation (RAG)#Agentic AI#Open-Source LLMs

$ subscribe --daily

Thử nghiệm EchoNet đánh giá khả năng phát hiện thông tin sai lệch của 9 LLM mở trọng số | Daily News