~/AI AGENTS/agent-arena-reveals-higher-token-consumption-in-improved-claude-opus-models

Agent Arena Tiết Lộ Mức Tiêu Thụ Token Cao Hơn Ở Các Mô Hình Claude Opus Cải Tiến

Agent Arena báo cáo rằng sự cải thiện hiệu suất của các mô hình thuộc dòng Opus của Anthropic (từ Opus 4.7 lên 4.8 và 5) đi kèm với sự gia tăng đáng kể về lượng token tiêu thụ. Cụ thể, lượng token trung bình được sử dụng để hoàn thành tác vụ đã tăng từ khoảng 8,5k ở phiên bản Opus 4.7 lên khoảng 21k ở phiên bản Opus 5. Điều này nêu bật sự đánh đổi quan trọng trong phát triển LLM, khi độ chính xác và khả năng suy luận cao hơn trong các quy trình tự động (agentic workflow) phải trả giá bằng việc tiêu thụ nhiều token hơn và chi phí vận hành cao hơn. Nó thúc đẩy các nhà phát triển phải cân nhắc kỹ tỷ lệ giữa chi phí và hiệu suất khi nâng cấp lên các phiên bản mô hình mới hơn. Mặc dù Claude Opus 5 mang lại kết quả hàng đầu trong suy luận và nghiên cứu khoa học, lượng token sử dụng của nó cao gấp gần 2,5 lần so với Opus 4.7 cho các tác vụ thực tế tương tự. Thử nghiệm này của Agent Arena đánh giá các mô hình dựa trên các tác vụ tự động (agentic) động và thực tế thay vì các bộ dữ liệu kiểm tra tĩnh dễ bị rò rỉ.

## KIẾN THỨC NỀN

Agent Arena, được phát triển bởi Arena.ai, là một nền tảng đánh giá độc lập được thiết kế để kiểm tra các tác nhân AI (AI agent) trên các tác vụ thực tế, trực tiếp thay vì các bài kiểm tra học thuật tĩnh. Dòng Claude Opus của Anthropic đại diện cho phân khúc mô hình ngôn ngữ lớn mạnh mẽ nhất của họ, với các phiên bản gần đây như Opus 5 giới thiệu khả năng suy luận nâng cao và mở rộng giới hạn token đầu ra.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI Agents#LLM Benchmarks#Machine Learning

$ subscribe --daily

Agent Arena Tiết Lộ Mức Tiêu Thụ Token Cao Hơn Ở Các Mô Hình Claude Opus Cải Tiến | Daily News