Qwen Max Vượt Qua Claude Opus Trên Bảng Xếp Hạng Agentic Của Artificial Analysis
Mô hình Qwen Max (được gọi là Qwen 3.8 Max) đã đạt vị trí dẫn đầu trên bảng xếp hạng agentic của Artificial Analysis. Mô hình này đã vượt qua Claude Opus (được gọi là Opus 5) để trở thành mô hình có thứ hạng cao nhất cho các quy trình công việc agentic. Cột mốc này đánh dấu sự thay đổi đáng kể trên các bảng xếp hạng LLM, cho thấy khả năng cạnh tranh ngày càng tăng của các mô hình Qwen trong các tác vụ đa bước phức tạp. Điều này mang lại cho các nhà phát triển một lựa chọn hàng đầu mới để xây dựng các tác nhân AI tự trị cần sử dụng công cụ và lập kế hoạch. Chỉ số Agentic Index của Artificial Analysis đánh giá các mô hình dựa trên khả năng thực hiện các công việc tri thức dài hạn, sử dụng công cụ và đưa ra quyết định tự trị. Hệ thống đánh giá này bao gồm các bài kiểm tra như AA-Briefcase, thử nghiệm các mô hình trên các quy trình công việc kinh doanh thực tế yêu cầu sản phẩm đầu ra như bảng tính và bài thuyết trình.
## KIẾN THỨC NỀN
Agentic AI (AI tác nhân) đề cập đến các hệ thống AI có thể theo đuổi mục tiêu, sử dụng công cụ và thực hiện hành động một cách tự trị trong các giới hạn do con người thiết lập. Artificial Analysis là một nền tảng độc lập chuyên đánh giá hiệu năng các mô hình AI, và chỉ số Agentic Index của họ tập trung cụ thể vào việc đánh giá các khả năng đa bước phức tạp này thay vì chỉ tạo văn bản đơn thuần.