LMSYS Arena Mở rộng Mô hình Hóa Phần thưởng Dựa trên Tùy chọn sang Đa phương thức
LMSYS Arena đã mở rộng mô hình hóa phần thưởng dựa trên tùy chọn từ văn bản sang các lĩnh vực khác bao gồm thị giác máy tính, tạo hình ảnh và lập trình. Họ đang huấn luyện các mô hình phần thưởng đặc thù cho từng phương thức bằng cách sử dụng hàng triệu cặp tùy chọn trực tiếp từ Arena, bao gồm hơn 3 triệu cặp cho tác vụ chuyển văn bản thành hình ảnh. Sự mở rộng này cung cấp các tập dữ liệu tùy chọn của con người ở quy mô lớn và chất lượng cao cho AI đa phương thức, điều này rất quan trọng đối với Học tăng cường từ phản hồi của con người (RLHF). Nó giúp căn chỉnh các mô hình đa phương thức sát hơn với sở thích của con người trên nhiều tác vụ khác ngoài văn bản. Mô hình phần thưởng chuyển văn bản thành hình ảnh được huấn luyện trên hơn 3 triệu cặp tùy chọn và được đánh giá trên bộ thử nghiệm công khai Multimodal Rewardbench 2 (MMRB2). MMRB2 là một bộ thử nghiệm thống nhất do Meta Research phát triển để đánh giá các mô hình phần thưởng về khả năng hiểu và tạo đa phương thức.
## KIẾN THỨC NỀN
Mô hình hóa phần thưởng dựa trên tùy chọn là một kỹ thuật học máy giúp học các hàm phần thưởng từ các so sánh cặp của con người, thường sử dụng các mô hình Bradley-Terry. Các mô hình phần thưởng này hoạt động như các "trọng tài" để định hướng hành vi của AI trong quá trình RLHF. MMRB2 (Multimodal Rewardbench 2) là một bộ thử nghiệm toàn diện được thiết kế để đánh giá các mô hình phần thưởng này trên các đầu vào văn bản và đa phương thức xen kẽ.