Vấn đề của các câu lệnh chung chung trong đánh giá mô hình AI
Một cuộc thảo luận trong cộng đồng làm nổi bật sự thất vọng ngày càng tăng đối với các bài đánh giá mô hình AI vốn phụ thuộc vào các câu lệnh đơn giản, chung chung thay vì các tác vụ phức tạp trong thực tế. Người dùng lập luận rằng các bài kiểm tra phổ biến, như tạo trò chơi hoặc trang web cơ bản từ các câu lệnh ngắn, không phản ánh đúng yêu cầu công việc thực tế. Khi các mô hình ngôn ngữ lớn (LLM) phát triển, các bài đánh giá truyền thống như câu hỏi trắc nghiệm hoặc tác vụ lập trình đơn giản không còn đo lường chính xác hiệu quả của mô hình trong môi trường thực tế. Việc chuyển dịch sang các bài đánh giá nghiêm ngặt hơn, dựa trên tác nhân (agent) là rất quan trọng để các nhà phát triển tìm kiếm các mô hình có khả năng xử lý các quy trình kỹ thuật phần mềm phức tạp. Mặc dù hầu hết các bài đánh giá được thiết kế để dễ dàng chấm điểm tự động, các nền tảng như SWE-bench đánh giá mô hình bằng cách yêu cầu chúng giải quyết các lỗi thực tế trên GitHub trong môi trường Docker cô lập. Tuy nhiên, nhiều người đánh giá tự do và nhà sáng tạo nội dung vẫn dựa vào các câu lệnh một dòng hời hợt cho các bài đánh giá của họ.
## KIẾN THỨC NỀN
Các bài đánh giá LLM tiêu chuẩn, chẳng hạn như MMLU hoặc HumanEval, trước đây tập trung vào kiến thức học thuật và tạo mã nguồn ngắn. Khi các tác nhân AI phát triển, các bài đánh giá như SWE-bench đã xuất hiện để kiểm tra mô hình trên các tác vụ kỹ thuật phần mềm nhiều bước, yêu cầu chúng chỉnh sửa mã nguồn và vượt qua các bài kiểm tra đơn vị (unit test). Những bài đánh giá hiện đại này nhằm thu hẹp khoảng cách giữa khả năng lý thuyết và tính hữu dụng trong thực tế.