Chatbot Arena công bố các phát hiện phân loại mới và cập nhật bảng xếp hạng
Chatbot Arena đã thông báo sẽ công bố các phát hiện mới theo từng danh mục cụ thể khi thu thập thêm nhiều lượt bình chọn và dấu vết tương tác của người dùng. Người dùng được mời khám phá bảng xếp hạng và chi tiết hiệu suất mô hình mới nhất trên trang web của họ. Việc phân tích chi tiết theo từng danh mục giúp các nhà nghiên cứu và phát triển hiểu rõ cách các mô hình ngôn ngữ lớn (LLM) hoạt động trong các lĩnh vực cụ thể thay vì chỉ dựa vào điểm Elo tổng thể. Dữ liệu chi tiết này rất quan trọng để lựa chọn mô hình phù hợp cho các tác vụ chuyên biệt như lập trình, lập luận hoặc viết lách sáng tạo. Nền tảng này dựa vào sở thích của người dùng được thu thập từ cộng đồng và các dấu vết tương tác để tính toán thứ hạng của mình. Các cập nhật mới nhất có thể được truy cập trực tiếp thông qua liên kết bảng xếp hạng chính thức của họ.
## KIẾN THỨC NỀN
Chatbot Arena (trước đây là LMArena) là một nền tảng công cộng phổ biến để đánh giá các mô hình ngôn ngữ lớn (LLM) thông qua thử nghiệm mù A/B. Người dùng nhập câu lệnh cho hai mô hình ẩn danh, bình chọn cho câu trả lời tốt hơn, và nền tảng sử dụng các lượt bình chọn này để tính điểm Elo. Đây đã trở thành một tiêu chuẩn đánh giá trong ngành AI, thường là nơi thử nghiệm các mô hình chưa ra mắt của các công ty lớn như OpenAI, Google và Anthropic.