Arena Ra Mắt Bảng Xếp Hạng Độ Xác Thực Để Đánh Giá Mô Hình AI
Arena đã công bố bảng xếp hạng độ xác thực mới, đánh giá các mô hình AI dựa trên tính chính xác thực tế của câu trả lời kết hợp với mức độ ưu tiên của người dùng. Hệ thống mới này nhằm mục đích đánh giá khách quan hiệu suất của mô hình và phòng ngừa hiện tượng ảo tưởng (hallucination). Các bảng xếp hạng đánh giá LLM truyền thống phụ thuộc nhiều vào sở thích của con người, vốn dễ bị ảnh hưởng bởi định dạng, phong cách hoặc độ dài thay vì tính chính xác thực tế. Việc đưa vào chỉ số trọng số độ xác thực giúp người dùng xác định mô hình nào thực sự đáng tin cậy và chính xác, chứ không chỉ là diễn đạt trôi chảy. Điểm số độ xác thực được tính toán bằng sự kết hợp có trọng số giữa sở thích của con người và tính chính xác của các tuyên bố trong câu trả lời của mô hình. Người dùng có thể truy cập bảng xếp hạng mới này trên các bảng xếp hạng Text và Search Arena thông qua một nút chuyển đổi tùy chọn trong giao diện người dùng.
## KIẾN THỨC NỀN
LMSYS Chatbot Arena là một nền tảng đo điểm chuẩn (benchmark) được sử dụng rộng rãi để xếp hạng các mô hình ngôn ngữ lớn (LLM) dựa trên sở thích của cộng đồng thông qua hệ số Elo. Tuy nhiên, những người đánh giá là con người thường bị ảnh hưởng bởi định kiến phong cách, ưu tiên các câu trả lời dài hơn hoặc được định dạng tốt hơn ngay cả khi chúng chứa lỗi thực tế hoặc ảo tưởng. Để giải quyết vấn đề này, Arena trước đây đã giới thiệu các phương pháp kiểm soát phong cách và hiện đang tích hợp các kiểm tra độ xác thực trực tiếp.