Các bộ kiểm thử AI mới tập trung vào đảo ngược mã nguồn và tái cấu trúc phần mềm
Một danh sách tổng hợp các bộ kiểm thử (benchmark) lập trình AI thế hệ mới—như Program-Bench, SRE-Bench và Code Migration—cho thấy sự chuyển dịch sang đánh giá các tác vụ kỹ thuật phần mềm phức tạp. Những bộ kiểm thử này thách thức các đại lý AI thực hiện đảo ngược mã nguồn nhị phân, tái dựng toàn bộ mã nguồn và chuyển đổi ngôn ngữ lập trình mà không cần tiếp cận mã nguồn gốc. Khi các mô hình LLM hàng đầu dần đạt điểm tối đa trên các bộ kiểm thử lập trình truyền thống như LiveCodeBench hay SWE-bench, các bài kiểm tra tập trung vào phân tích tệp nhị phân giúp đánh giá khả năng thấu hiểu chương trình thực sự thay vì chỉ học vẹt mẫu mã. Việc chinh phục các tác vụ này đánh dấu bước tiến lớn hướng tới các đại lý AI tự chủ có khả năng kiểm thử bảo mật, hiện đại hóa hệ thống cũ và bảo trì phần mềm cấp thấp. Các bộ kiểm thử như SRE-Bench sử dụng các tệp nhị phân tùy chỉnh được gia cố bằng kỹ thuật chống phân tích để kiểm tra khả năng đảo ngược mã nguồn, trong khi Program-Bench yêu cầu dựng lại toàn bộ mã nguồn chỉ từ tệp nhị phân và tài liệu hướng dẫn mà không dùng công cụ giải biên dịch. Điểm số của các mô hình hiện tại trên các tác vụ phức tạp này vẫn còn thấp hơn nhiều so với các bộ kiểm thử lập trình thông thường, cho thấy còn nhiều dư địa để phát triển.
## KIẾN THỨC NỀN
Các bộ kiểm thử lập trình AI truyền thống thường đánh giá mô hình qua các bài toán thuật toán riêng lẻ hoặc các yêu cầu sửa lỗi (pull request) đơn giản bằng các công cụ như LiveCodeBench hay SWE-bench. Đảo ngược mã nguồn (reverse engineering) là quá trình phân tích mã nhị phân đã biên dịch (mã máy hoặc hợp ngữ) để suy ra chức năng của nó mà không có mã nguồn gốc. Các bộ kiểm thử đánh giá năng lực này giúp đo lường khả năng tư duy sâu của AI về logic thực thi, kiến trúc bộ nhớ và hành vi hệ thống cấp thấp.