~/ARTIFICIAL I/anthropic-s-claude-opus-5-added-to-agent-arena-for-real-world

Claude Opus 5 của Anthropic được đưa vào Agent Arena để đánh giá thực tế

Mô hình mới của Anthropic, Claude Opus 5, đã được tích hợp vào nền tảng Agent Arena. Người dùng hiện có thể thử nghiệm và so sánh hiệu suất của mô hình này trên các tác vụ thực tế trong cả Chế độ Agent (Agent Mode) và Chế độ Đối đầu (Battle Mode). Mặc dù Claude Opus 5 đạt mức trí tuệ tương đương Fable 5 trên các bài kiểm tra tĩnh, việc thử nghiệm trên Agent Arena sẽ đánh giá khả năng thực tế của nó trong việc điều phối công cụ và hoàn thành các tác vụ phức tạp, dài hạn. Điều này giúp các nhà nghiên cứu và phát triển hiểu rõ hiệu suất của mô hình trong môi trường thực tế động thay vì chỉ qua các bài kiểm tra lý thuyết. Mô hình được báo cáo là đạt mức độ trí tuệ tương đương Fable 5 trên các bài kiểm tra tĩnh. Tại Agent Arena, hiệu suất của nó sẽ được xếp hạng động dựa trên các chỉ số như độ tin cậy của công cụ, khả năng hoàn thành tác vụ và khả năng điều hướng (steerability).

## KIẾN THỨC NỀN

Các bài kiểm tra AI truyền thống thường mang tính tĩnh và khó phản ánh chính xác khả năng hoạt động của các mô hình ngôn ngữ lớn dưới vai trò là các tác nhân tự trị (autonomous agents) trong thế giới thực. Agent Arena là một nền tảng đánh giá được thiết kế để xếp hạng động các mô hình dựa trên cách chúng duyệt web, nghiên cứu, lập trình và tương tác với nhiều công cụ khác nhau. Fable 5 của Anthropic là một mô hình hiệu suất cao nổi tiếng với khả năng suy luận nâng cao và tính tự trị trong các tác vụ vòng đời phần mềm phức tạp.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Artificial Intelligence#Large Language Models#AI Benchmarking#Anthropic

$ subscribe --daily

Claude Opus 5 của Anthropic được đưa vào Agent Arena để đánh giá thực tế | Daily News