Các mô hình LLM trọng số mở đạt điểm thấp hơn mô hình độc quyền trên bộ kiểm thử AA-Omniscience
Một cuộc thảo luận trên r/LocalLLaMA đã chỉ ra rằng các mô hình ngôn ngữ trọng số mở hàng đầu đạt điểm số thấp hơn trên chỉ số AA-Omniscience so với các mô hình độc quyền như dòng Gemini của Google. Bài đăng đặt câu hỏi tại sao các mô hình mở hàng đầu lại tụt hậu so với các mô hình mã nguồn đóng trên bài đánh giá khả năng truy xuất thực tế và độ tin cậy tri thức này. Khoảng cách hiệu suất này nhấn mạnh những thách thức tiếp diễn trong việc hiệu chỉnh tri thức và ngăn ngừa ảo giác của các mô hình trọng số mở so với các API thương mại. Các bộ kiểm thử như AA-Omniscience cho thấy tầm quan trọng của tính tự nhận thức ở mô hình và việc biết từ chối trả lời thay vì đoán sai. Được phát triển bởi Artificial Analysis, bộ kiểm thử AA-Omniscience đánh giá khả năng truy xuất thông tin thực tế qua 6.000 câu hỏi thuộc 42 chủ đề có giá trị kinh tế. Bài kiểm tra sử dụng thang điểm từ -100 đến 100, trong đó phạt nặng các câu trả lời ảo giác và thưởng cho các mô hình biết tự chối trả lời khi tri thức không đủ.
## KIẾN THỨC NỀN
Các bộ kiểm thử mô hình ngôn ngữ tiêu chuẩn thường chỉ đo độ chính xác thô trên các câu hỏi trắc nghiệm, điều này có thể vô tình thưởng cho việc đoán may rủi và bỏ qua lập luận không chắc chắn. Hiệu chỉnh tri thức đo lường mức độ chính xác khi mô hình tự đánh giá độ không chắc chắn của chính mình. Bộ kiểm thử AA-Omniscience được tạo ra để giải quyết vấn đề này bằng cách đánh giá song song độ chính xác đa lĩnh vực và khả năng đưa ra câu trả lời 'tôi không biết' khi thích hợp.