Qwen 3.8-max của Alibaba và Muse-spark-1.2 của Meta lọt top bảng xếp hạng LMSYS Arena
Trong tuần thứ 32 của năm 2026, mô hình Qwen 3.8-max của Alibaba và Muse-spark-1.2 (xHigh) của Meta đã lần lượt ra mắt ở vị trí thứ 6 và thứ 4 trên bảng xếp hạng tổng thể của LMSYS Arena. Bên cạnh đó, mô hình Kimi-k3-max của Moonshot cũng vươn lên vị trí thứ 6 trên bảng xếp hạng lập trình, cho thấy sự tiến bộ mạnh mẽ của các mô hình AI Trung Quốc. Việc các mô hình mới này lọt vào nhóm dẫn đầu của LMSYS Arena làm nổi bật sự cạnh tranh ngày càng gay gắt giữa các tập đoàn công nghệ Trung Quốc và các phòng nghiên cứu AI phương Tây. Điều này chứng minh rằng các mô hình Trung Quốc đang trở nên cạnh tranh mạnh mẽ cả về năng lực chung lẫn các tác vụ chuyên biệt như lập trình. Qwen 3.8-max đạt điểm Elo là 1497, ngang bằng với Claude-opus-4-6 của Anthropic, trong khi Muse-spark-1.2 (xHigh) của Meta đạt 1498 điểm. Mô hình Claude-fable-5 của Anthropic tiếp tục giữ vị trí quán quân trên cả bảng xếp hạng tổng thể lẫn bảng xếp hạng lập trình.
## KIẾN THỨC NỀN
LMSYS Chatbot Arena là một nền tảng mở dựa trên đóng góp của cộng đồng được công nhận rộng rãi để đánh giá các mô hình LLM thông qua thử nghiệm mù A/B. Nền tảng này tính toán điểm xếp hạng Elo dựa trên sở thích của người dùng từ các so sánh song song giữa hai mô hình ẩn danh, đóng vai trò là một tiêu chuẩn quan trọng để đánh giá hiệu suất thực tế của LLM.