Cập nhật từ Agent Arena: GPT-5.6 Sol, Terra và Luna cải thiện hiệu suất
Agent Arena đã báo cáo những cải tiến về hiệu suất cho một số mô hình AI, trong đó GPT-5.6 Sol giành vị trí thứ hai trên bảng xếp hạng với mức tăng 10,1%. Ngoài ra, các mô hình Terra (+4,0%) và Luna (+3,3%) cũng ghi nhận mức cải thiện tích cực, xếp ngay cạnh Claude Opus 4.8 (+3,5%). Những cập nhật này làm nổi bật sự phát triển nhanh chóng của các tác nhân AI (AI agents) trong việc xử lý các tác vụ phức tạp và động thay vì các bài kiểm tra tĩnh. Sự cạnh tranh sát sao giữa các biến thể GPT-5.6 và Claude Opus 4.8 cho thấy khoảng cách đang dần thu hẹp giữa các mô hình tác nhân hàng đầu. Các đánh giá được thực hiện ở thiết lập "xHigh" trong Agent Arena, một nền tảng được thiết kế để thử nghiệm các tác nhân trong môi trường tương tác trực tiếp. Công cụ đánh giá này ngăn các mô hình ghi nhớ đáp án bằng cách kiểm tra chúng trên các quy trình làm việc thực tế như lập trình và duyệt web.
## KIẾN THỨC NỀN
Được phát triển bởi Arena.ai, Agent Arena là một nền tảng đánh giá (benchmark) các tác nhân AI tự trị trong định dạng thi đấu đối kháng trực tiếp 5v5. Khác với các bài kiểm tra tĩnh truyền thống, nền tảng này tập trung vào các tác vụ thực tế như nghiên cứu, lập trình và duyệt web để đo lường năng lực thực tiễn.