~/AI BENCHMARK/swe-sweep-a-new-benchmark-for-proactive-ai-bug-finding-and-fixing

SWE-sweep: Benchmark mới đánh giá khả năng tự phát hiện và sửa lỗi của AI

Các nhà nghiên cứu từ Meta, Stanford, Harvard và UW đã ra mắt SWE-sweep, một benchmark mã nguồn mở dùng để đánh giá khả năng các đại lý AI tự tìm kiếm và sửa các lỗi ẩn thực tế trên toàn bộ codebase. Khác với các benchmark sửa lỗi thụ động truyền thống, SWE-sweep yêu cầu mô hình chủ động quét mã nguồn repository để khắc phục sự cố trước khi người dùng gặp phải. Benchmark này chuyển dịch việc đánh giá đại lý AI lập trình từ sửa lỗi thụ động sang tự động bảo trì codebase một cách chủ động. Kết quả cho thấy các mô hình tiên tiến hiện nay vẫn đạt điểm thấp bất ngờ khi phải tự phát hiện khiếm khuyết phần mềm mà không có báo cáo lỗi cụ thể từ người dùng. Các mô hình được đánh giá dựa trên một tập hợp lỗi thực tế được ẩn đi và sàng lọc kỹ lưỡng để đảm bảo có thể phát hiện trực tiếp từ codebase. Toàn bộ mã nguồn và dữ liệu benchmark được phát hành công khai theo giấy phép MIT, trong đó mô hình GPT-5.6 Luna (xhigh) hiện nổi bật về hiệu quả chi phí trên bảng xếp hạng.

## KIẾN THỨC NỀN

Các benchmark lập trình AI tiêu chuẩn thường cung cấp cho mô hình mô tả sự cố hoặc báo cáo lỗi chi tiết và đánh giá khả năng sửa lỗi. Tuy nhiên, kỹ thuật phần mềm trong thực tế đòi hỏi việc chủ động phân tích tĩnh, kiểm tra các trường hợp ngoại lệ và khám phá toàn bộ repository để ngăn ngừa lỗi trước khi triển khai.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI Benchmarks#LLMs#Software Engineering#AI Agents#Code Generation

$ subscribe --daily

SWE-sweep: Benchmark mới đánh giá khả năng tự phát hiện và sửa lỗi của AI | Daily News