Nhà phát triển báo cáo điểm số 96% nghi vấn của Ox Alpha trên SWE-bench Verified Mini
Một nhà phát triển báo cáo rằng mô hình AI bí ẩn "Ox Alpha" đã đạt tỷ lệ giải quyết 96% (48 trên 50 nhiệm vụ) trên tập dữ liệu SWE-bench Verified Mini bằng cách sử dụng khung mini-swe-agent chính thức. Tuy nhiên, nhà phát triển này bày tỏ sự hoài nghi lớn về kết quả này, cho rằng nó có thể bị thổi phồng do nhiễm dữ liệu hoặc do tập dữ liệu con cụ thể được sử dụng. Điểm chuẩn này nhấn mạnh những thách thức đang diễn ra trong việc đánh giá các mô hình ngôn ngữ lớn (LLM), đặc biệt là nguy cơ nhiễm dữ liệu khi các mô hình ghi nhớ dữ liệu huấn luyện từ các kho lưu trữ phổ biến như Django và Sphinx. Nó cũng đặt ra câu hỏi về khả năng thực sự của "Ox Alpha", một mô hình ẩn danh được cung cấp miễn phí trên OpenRouter. Thử nghiệm được thực hiện cục bộ bằng công cụ Docker chính thức của SWE-bench với khung mini-swe-agent v2.4.6, trong đó Ox Alpha chỉ thất bại ở hai nhiệm vụ Django. Nhà phát triển lưu ý rằng tập dữ liệu con 50 nhiệm vụ này chỉ chứa các kho lưu trữ Django và Sphinx, vốn xuất hiện rất nhiều trong dữ liệu huấn luyện LLM, khiến khả năng ghi nhớ máy móc là rất cao.
## KIẾN THỨC NỀN
SWE-bench Verified là một tập hợp con gồm 500 nhiệm vụ kỹ thuật phần mềm được lọc bởi con người, thiết kế để kiểm tra các tác nhân AI trong việc giải quyết các vấn đề thực tế trên GitHub. Phiên bản "mini" là một tập hợp con nhỏ hơn gồm 50 nhiệm vụ, và mini-swe-agent là một khung tác nhân AI gọn nhẹ, được áp dụng rộng rãi để chạy các đánh giá này một cách hiệu quả.