Hiện tượng loãng bảng xếp hạng: Khi các mô hình LLM giống hệt nhau chiếm lĩnh top đầu
Một bài đăng trong cộng đồng đã chỉ ra cách một mô hình ngôn ngữ lớn (LLM) duy nhất hoặc các biến thể nhỏ của nó có thể chiếm nhiều vị trí dẫn đầu trên các bảng xếp hạng AI mã nguồn mở dưới các tên gọi khác nhau. Sự loãng này xảy ra khi người dùng tải lên các mô hình trùng lặp hoặc thực hiện các tinh chỉnh nhỏ, làm sai lệch bảng xếp hạng. Vấn đề này làm suy giảm tính trung thực của các bài kiểm tra đánh giá (benchmark) AI, khiến các nhà phát triển gặp khó khăn trong việc xác định các mô hình thực sự độc đáo và sáng tạo. Nó cũng đặt ra câu hỏi về tính hiệu quả của các nền tảng đánh giá hiện tại như Open LLM Leaderboard của Hugging Face. Hiện tượng này thường được thúc đẩy bởi các kỹ thuật hợp nhất mô hình (model merging) hoặc chỉ đơn giản là đổi tên, cho phép các nhà phát triển gửi các phiên bản thay đổi nhẹ của các mô hình hiệu suất cao để thăng hạng. Hành vi này làm lộn xộn các bảng xếp hạng và gây phức tạp cho việc đánh giá mô hình độc lập.
## KIẾN THỨC NỀN
Các nền tảng như Open LLM Leaderboard của Hugging Face theo dõi và xếp hạng hiệu suất của các LLM mã nguồn mở trên nhiều bài kiểm tra khác nhau. Tuy nhiên, các kỹ thuật như hợp nhất mô hình (model merging) — kết hợp trọng số của nhiều LLM bằng các công cụ như mergekit mà không cần huấn luyện lại tốn kém — đã giúp dễ dàng tạo ra các mô hình phái sinh có hiệu suất tương tự như mô hình gốc.