Bilibili Ra Mắt Bảng Xếp Hạng "AI Infinite Arena" Đánh Giá LLM Dựa Trên Sáng Tạo Nội Dung
Nền tảng video Trung Quốc Bilibili đã ra mắt "AI Infinite Arena", một bảng xếp hạng cập nhật thời gian thực nơi các nhà sáng tạo nội dung đánh giá hơn 100 mô hình ngôn ngữ lớn thông qua quy trình làm việc thực tế, lập trình, suy luận và các tác vụ sáng tạo. Trong vòng xếp hạng đầu tiên, GPT-6 Astra đã vươn lên dẫn đầu sau khi chiến thắng ở 10 bài kiểm tra của các nhà sáng tạo, trong khi các mô hình nội địa Trung Quốc chiếm ba trong năm vị trí đầu bảng. Trong khi các bộ kiểm thử LLM truyền thống dựa trên các bài kiểm tra chuẩn hóa tĩnh hoặc bình chọn ẩn danh, nền tảng của Bilibili khai thác các nhà sáng tạo video để thử nghiệm mô hình trong những quy trình làm việc thực tế chuyên biệt. Điều này phản ánh xu hướng ngày càng tăng của việc kiểm thử cộng đồng do nền tảng dẫn dắt nhằm thu hút cộng đồng công nghệ và giúp người dùng phổ thông lựa chọn công cụ AI cho các ứng dụng thực tế cụ thể. Không giống như các bộ kiểm thử học thuật chuẩn hóa như MMLU hay hệ thống bình chọn đối đầu ẩn danh của LMSYS Chatbot Arena, nền tảng không giới hạn tiêu chí hay chủ đề đánh giá, cho phép các nhà sáng tạo tự thiết kế bài kiểm tra dựa trên chuyên môn của họ. Các mô hình được thử nghiệm bao gồm nhiều hệ thống lớn trong nước và quốc tế như ChatGPT của OpenAI, Claude của Anthropic, Gemini của Google, DeepSeek, Kimi, Đậu Bao, Qwen và dòng mô hình GLM của Zhipu AI.
## KIẾN THỨC NỀN
Đánh giá mô hình ngôn ngữ lớn (LLM) thường dựa vào các bộ kiểm thử học thuật tĩnh (như MMLU) hoặc các nền tảng đấu trường cộng đồng như LMSYS Chatbot Arena, nơi sử dụng hệ thống xếp hạng Elo dựa trên bình chọn sở thích của người dùng. Dòng mô hình GLM của Zhipu AI là một trong những chuỗi mô hình ngôn ngữ lớn nền tảng nổi bật của Trung Quốc, cạnh tranh trực tiếp với các mô hình phương Tây trong nhiều tác vụ suy luận và chuyên ngành.