~/AI BENCHMARK/chinese-ai-models-surge-in-arena-rankings-as-alibaba-s-wan-3

Mô hình AI Trung Quốc bứt phá trên Arena, Wan 3.0 của Alibaba vào Top 3 Video

Bảng xếp hạng AI mới nhất trên Arena ghi nhận sự bứt phá của các mô hình Trung Quốc, với wan3.0 của Alibaba vươn lên top 3 bảng xếp hạng video và qwen3.8-max-0902 đứng thứ 4 ở bảng phát triển frontend. Ngoài ra, claude-fable-5.1-max của Anthropic và gemini-3.8-flash-high của Google cũng lần lượt ra mắt ở vị trí thứ 3 và thứ 8 trên bảng xếp hạng tổng thể. Dù các nhà phát triển hàng đầu như Anthropic tiếp tục thống trị bảng xếp hạng năng lực tổng thể và lập trình, các tập đoàn công nghệ Trung Quốc đang rút ngắn khoảng cách nhanh chóng ở các mảng chuyên biệt như tạo video và lập trình frontend. Sự chuyển dịch này cho thấy cuộc cạnh tranh giữa các mô hình AI phương Tây và Trung Quốc đang ngày càng gay gắt trên nhiều phân khúc ứng dụng. Ở bảng xếp hạng tổng thể, claude-fable-5 của Anthropic giữ vị trí dẫn đầu với điểm ELO 1507, theo sau sát sao là claude-opus-4-6-high (1505 ELO). Bảng xếp hạng được tính toán dựa trên kết quả bình chọn ngẫu nhiên, ẩn danh từ người dùng thông qua hệ thống điểm ELO, thể hiện sự ưu ái chủ quan của người dùng thay vì các chỉ số đo lường hiệu năng tuyệt đối.

## KIẾN THỨC NỀN

Chatbot Arena (arena.ai) là nền tảng đánh giá mô hình AI dựa trên đóng góp cộng đồng do LMSYS phát triển, ứng dụng phương pháp thử nghiệm A/B ẩn danh và ngẫu nhiên. Người dùng gửi câu lệnh cho hai mô hình ẩn danh cùng lúc và chọn câu trả lời tốt hơn, giúp hệ thống tính điểm và xếp hạng mô hình bằng hệ số ELO và mô hình thống kê Bradley-Terry.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI Benchmarks#LLM#LMSYS Arena#Tech News

$ subscribe --daily

Mô hình AI Trung Quốc bứt phá trên Arena, Wan 3.0 của Alibaba vào Top 3 Video | Daily News