Opus 5 Đạt Kỷ Lục Mới Trong Thử Nghiệm Lập Trình Bằng Agent Trên Terminal
Một bản cập nhật thử nghiệm hiệu năng cho thấy mô hình AI 'Opus 5' đã đạt điểm số kỷ lục mới là 43,3% trên Frontier-Bench v0.1 về lập trình bằng agent trên terminal. Kết quả này vượt qua Fable 5 (33,7%) và cao hơn gấp đôi so với phiên bản Opus 4.8 trước đó. Sự tiến bộ này cho thấy tốc độ phát triển nhanh chóng của các quy trình làm việc bằng agent, nơi các agent AI hoạt động trực tiếp trong terminal để giải quyết các tác vụ kỹ thuật phần mềm phức tạp. Ngoài ra, việc đạt hiệu năng tương đương Fable 5 trên FrontierCode v1.1 với chi phí chỉ bằng một nửa làm nổi bật sự cải thiện đáng kể về hiệu quả chi phí cho các công cụ lập trình. Mặc dù Opus 5 dẫn đầu trên Frontier-Bench v0.1, nó chỉ đạt kết quả ngang bằng với Fable 5 trên benchmark FrontierCode v1.1, vốn đo lường khả năng tích hợp mã nguồn (mergeability). Kết quả này cho thấy dù năng lực của agent đang cải thiện, vẫn còn nhiều không gian để phát triển khi điểm số cao nhất vẫn dưới 50%.
## KIẾN THỨC NỀN
Lập trình bằng agent trên terminal (agentic terminal coding) đề cập đến việc sử dụng các agent AI từ giao diện dòng lệnh để kiểm tra kho lưu trữ mã nguồn, lập kế hoạch thay đổi, chạy lệnh và lặp lại các tác vụ phát triển phần mềm. Frontier-Bench là một bộ thử nghiệm đang phát triển được thiết kế để đo lường các năng lực này của agent bằng các tác vụ khó và chất lượng cao. FrontierCode là một benchmark khác đánh giá xem mã nguồn do các agent AI tạo ra có đủ chất lượng để một người quản trị chấp nhận tích hợp (merge) hay không.