~/AI BENCHMARK/humor-arena-benchmarking-llms-on-joke-generation-using-an-automated-judge

Humor Arena: Đánh giá khả năng tấu hài của các mô hình LLM bằng giám khảo tự động

Các nhà nghiên cứu đã giới thiệu Humor Arena, một bộ tiêu chuẩn so sánh 20 phiên bản mô hình LLM dựa trên 360 câu hỏi tạo trò đùa bằng một giám khảo tự động mã nguồn mở được tinh chỉnh. Mô hình Fable 5 đạt điểm số ước tính cao nhất với 66,8 điểm trên 100 lượt so sánh đối đầu. Đánh giá các tác vụ mở mang tính chủ quan như trò đùa từ lâu đã là thách thức đối với các bộ tiêu chuẩn tự động vốn chỉ tập trung vào sự thật khách quan hay mã nguồn. Việc xây dựng một giám khảo tự động có độ tương quan cao với sở thích hài hước của con người sẽ mang lại một khuôn khổ có khả năng mở rộng để đánh giá các năng lực định tính của AI. Bộ tiêu chuẩn đã kiểm thử các mô hình trên 360 câu hỏi cố định (mỗi câu yêu cầu 4 trò đùa) và giấu tên mô hình trong quá trình chấm điểm. Giám khảo tự động đã được kiểm định dựa trên 1.400 đánh giá từ 50 người để xác nhận rằng điểm số của nó bám sát với đánh giá chủ quan của con người.

## KIẾN THỨC NỀN

LLM-as-a-Judge (sử dụng LLM làm giám khảo) là phương pháp đánh giá trong đó một mô hình ngôn ngữ chuyên biệt chấm điểm đầu ra của các mô hình AI khác dựa trên các tiêu chí cụ thể. Trong khi các thước đo truyền thống gặp khó khăn với bài viết sáng tạo mở, việc tinh chỉnh một giám khảo tự động dựa trên dữ liệu sở thích của con người giúp tạo ra quy trình chấm điểm đáng tin cậy và có thể mở rộng mà không cần đánh giá thủ công liên tục.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI Benchmarks#LLM Evaluation#Natural Language Processing#Humor Evaluation

$ subscribe --daily

Humor Arena: Đánh giá khả năng tấu hài của các mô hình LLM bằng giám khảo tự động | Daily News