Kiểm tra các Benchmark LLM lớn phát hiện tới 12% câu hỏi bị lỗi
Một đợt kiểm tra độc lập đối với các bộ benchmark LLM phổ biến gồm GPQA, MMLU-Pro và MMMU-Pro cho thấy có tới 12% câu hỏi bị lỗi do sai định dạng, sai đáp án hoặc có nhiều câu trả lời đúng. Để khắc phục, nhà nghiên cứu đã phát hành các phiên bản sạch (clean) của các tập dữ liệu này, giúp độ chính xác của các mô hình hàng đầu tăng vọt lên khoảng 98%. Đợt kiểm tra này giải thích lý do tại sao các mô hình AI hàng đầu dường như bị giới hạn hiệu suất ở mức 92-93% trên các benchmark như GPQA-Diamond, cho thấy hạn chế này đến từ chất lượng tập dữ liệu chứ không phải khả năng của mô hình. Bằng cách cung cấp các benchmark đã được làm sạch, các nhà nghiên cứu giờ đây có thể đo lường chính xác hơn giới hạn suy luận của các mô hình tiên tiến mà không bị ảnh hưởng bởi các câu hỏi bị lỗi. Đợt kiểm tra bao gồm GPQA (Diamond và Extended), MMLU-Pro và MMMU-Pro, và tác giả đã chia sẻ các tập dữ liệu sạch trên Hugging Face cùng với tích hợp cho công cụ lm-evaluation-harness của EleutherAI. Một sổ cái chi tiết ghi lại lý do tại sao từng câu hỏi bị lỗi bị gắn cờ cũng đã được công bố rộng rãi.
## KIẾN THỨC NỀN
Các bộ benchmark như GPQA (Graduate-Level Google-Proof Q&A) và MMLU-Pro được sử dụng rộng rãi để đánh giá khả năng suy luận nâng cao và năng lực học thuật của các mô hình ngôn ngữ lớn. GPQA bao gồm các câu hỏi STEM cực khó được thiết kế để thách thức ngay cả các chuyên gia trình độ tiến sĩ, trong khi MMLU-Pro là phiên bản mở rộng của benchmark MMLU cổ điển nhằm tăng độ khó bằng cách mở rộng số lượng tùy chọn trắc nghiệm.