SWE-rebench Phát Hành Bản Cập Nhật Đa Ngôn Ngữ Cho Các Tác Vụ Kỹ Thuật Phần Mềm
Trình đánh giá SWE-rebench đã phát hành một bản cập nhật đa ngôn ngữ lớn, mở rộng phạm vi đánh giá các tác vụ kỹ thuật phần mềm ngoài Python để bao gồm thêm Go, Java, Rust và TypeScript. Bản cập nhật này đánh giá nhiều mô hình trọng số mở (open-weight), bao gồm GLM-5.2, DeepSeek-V4 Pro và các phiên bản Qwen khác nhau. Việc đánh giá các mô hình ngôn ngữ lớn (LLM) trên nhiều ngôn ngữ lập trình mang lại thước đo thực tế hơn về tính hữu dụng của chúng trong các môi trường phát triển phần mềm đa dạng ngoài đời thực. Điều này giúp các nhà phát triển xác định mô hình nào hoạt động tốt nhất cho các ngôn ngữ cụ thể và cấu hình triển khai cục bộ. Trong đợt đánh giá mới nhất, GLM-5.2 đạt hiệu suất cao nhất với tỷ lệ Pass@1 là 62,9% và Pass@5 là 81,1%, vượt qua thành công các tác vụ ở cả năm ngôn ngữ với tỷ lệ 39,6%. Các nhà tổ chức benchmark dự kiến sẽ phát hành một bản cập nhật khác sau 3-4 tuần nữa, tập trung vào các mô hình được tối ưu hóa cho việc triển khai cục bộ.
## KIẾN THỨC NỀN
SWE-rebench là một bộ công cụ đánh giá (benchmark) được thiết kế để kiểm tra các mô hình ngôn ngữ lớn trên các tác vụ kỹ thuật phần mềm thực tế bằng cách sử dụng các lỗi (issue) mới từ GitHub nhằm ngăn chặn tình trạng rò rỉ dữ liệu (data contamination). Chỉ số "Pass@k" đo lường xác suất có ít nhất một trong số k mẫu mã nguồn được tạo ra vượt qua tất cả các trường hợp kiểm thử (test case).