Arena AI chia sẻ phương pháp luận và điểm số cho hệ thống đánh giá tự động AutoEval
Arena AI (trước đây là Chatbot Arena) đã chia sẻ chi tiết về phương pháp luận và cách tính điểm chính thức cho AutoEval, hệ thống đánh giá tự động dành cho các mô hình ngôn ngữ lớn (LLM). Bản phát hành này mang lại sự minh bạch về cách các điểm chuẩn tự động được tính toán và tích hợp cùng với xếp hạng Elo dựa trên tùy chọn của con người. Khi việc đánh giá LLM ngày càng phụ thuộc vào kiểm thử tự động để mở rộng quy mô vượt qua các giới hạn của con người, việc hiểu rõ phương pháp luận đằng sau AutoEval sẽ giúp các nhà phát triển tin tưởng và diễn giải đúng các bảng xếp hạng tự động. Điều này giúp thu hẹp khoảng cách giữa đánh giá cộng đồng từ con người và các bài kiểm tra tự động có khả năng mở rộng cao. Tài liệu chi tiết hóa cách tính điểm AutoEval, cung cấp một phương pháp chuẩn hóa để đo lường hiệu suất của LLM mà không chỉ phụ thuộc vào việc gắn nhãn thủ công của con người. Điều này cho phép đánh giá các mô hình nhanh hơn và khách quan hơn trên nhiều tác vụ khác nhau như lập luận logic và dịch thuật.
## KIẾN THỨC NỀN
Arena AI, trước đây gọi là LMSYS Chatbot Arena, là một nền tảng được công nhận rộng rãi để đánh giá hiệu năng của các LLM bằng cách sử dụng bình chọn từ cộng đồng và hệ thống điểm Elo. Mặc dù đánh giá từ con người vẫn là tiêu chuẩn vàng, đánh giá tự động (AutoEval) đã nổi lên như một công cụ quan trọng để mở rộng quy mô thử nghiệm trên hàng ngàn mô hình và câu lệnh một cách hiệu quả.