Arena phân tích hơn 3 triệu lượt bình chọn về các danh mục đánh giá mô hình tạo ảnh
Arena đã phân tích hơn 3 triệu lượt bình chọn của người dùng để đánh giá mức độ độc lập của 7 danh mục tạo ảnh. Kết quả phân tích cho thấy sự trùng lặp đáng kể giữa một số danh mục như Ảnh thực tế (Photorealistic) và Chân dung (Portraits) ở mức 64%, nhưng hầu như không có sự trùng lặp (dưới 1%) giữa Ảnh thực tế và Nghệ thuật (Art). Dữ liệu thực nghiệm này giúp các nhà thiết kế hệ thống đánh giá hiểu rõ hơn cách người dùng đánh giá hình ảnh do AI tạo ra, đồng thời nhấn mạnh nhu cầu tinh chỉnh các danh mục đánh giá. Nó chỉ ra rằng trong khi một số tác vụ cần các tiêu chuẩn đánh giá riêng biệt, thì các tác vụ khác có thể được hợp nhất do có độ trùng lặp cao. Nghiên cứu cũng phát hiện ra mức độ trùng lặp 36% giữa hai danh mục Thiết kế thương mại (Commercial Design) và Kết xuất văn bản (Text Rendering). Những phát hiện này gợi ý rằng sở thích của người dùng và hiệu suất của mô hình trong việc tạo ảnh phụ thuộc rất lớn vào từng tác vụ cụ thể thay vì đồng đều trên mọi phong cách.
## KIẾN THỨC NỀN
Text-to-Image Arena của LMSYS là một nền tảng phổ biến nơi người dùng so sánh song song các mô hình tạo ảnh AI ẩn danh và bình chọn cho kết quả tốt hơn. Các lượt bình chọn này được sử dụng để tính điểm Elo, thiết lập bảng xếp hạng công khai cho hiệu suất của mô hình. Việc phân loại các trận đấu này giúp đánh giá cách các mô hình hoạt động trong các lĩnh vực chuyên biệt như kết xuất văn bản, ảnh thực tế hoặc phong cách nghệ thuật.