Chỉ trích về "Chỉ số Trí tuệ" của Artificial Analysis gây tranh cãi về benchmark LLM
Một người dùng Reddit đã chỉ trích "Chỉ số Trí tuệ" (Intelligence Index) của Artificial Analysis vì xếp hạng các mô hình nhỏ hơn như Qwen 27B cao hơn các mô hình hàng đầu (frontier models), đặt ra câu hỏi về tính hợp lệ của các benchmark LLM tổng hợp. Lời phê bình này nhấn mạnh cách một điểm số tổng hợp duy nhất có thể phản ánh sai lệch khả năng thực tế của mô hình trong các tình huống thực tế. Khi các LLM ngày càng phổ biến, các nhà phát triển và doanh nghiệp phụ thuộc nhiều vào các bảng xếp hạng để lựa chọn mô hình, nhưng các điểm số tổng hợp có thể gặp phải Định luật Goodhart, khi việc tối ưu hóa cho benchmark làm mất đi giá trị đo lường của nó. Cuộc tranh luận này nhấn mạnh sự hoài nghi ngày càng tăng đối với các đánh giá bằng một con số duy nhất cho các năng lực AI phức tạp. Chỉ số Trí tuệ của Artificial Analysis là một chỉ số tổng hợp gộp nhiều bài đánh giá về toán học, khoa học, lập trình và lập luận. Các nhà phê bình lập luận rằng việc đánh đồng hiệu suất của một mô hình 27 tỷ tham số với các mô hình hàng đầu trên chỉ số này là gây hiểu lầm, vì các mô hình nhỏ hơn thường gặp khó khăn với các tác vụ rộng và phức tạp hơn vốn không được ghi nhận bởi các benchmark cụ thể.
## KIẾN THỨC NỀN
Việc đánh giá hiệu năng (benchmarking) các LLM bao gồm việc chạy thử chúng trên các bộ dữ liệu tiêu chuẩn hóa để đánh giá các kỹ năng cụ thể. Artificial Analysis là một nền tảng tổng hợp các benchmark này thành một "Chỉ số Trí tuệ" duy nhất để giúp người dùng so sánh các mô hình, nhưng sự tổng hợp này có thể che lấp những khác biệt đáng kể về khả năng lập luận chung và tính hữu dụng trong thực tế.