Ra mắt CyberGym: Bộ công cụ đánh giá AI trong các tác vụ an ninh mạng
Bộ công cụ đánh giá CyberGym đã được giới thiệu nhằm đo lường khả năng của các tác nhân AI trong việc xử lý các tác vụ an ninh mạng thực tế. Nó đánh giá các mô hình thông qua việc phân tích, tái dựng lỗ hổng và phát triển bản vá. Khi các tác nhân AI ngày càng được triển khai nhiều trong phát triển phần mềm và bảo mật, một bộ đánh giá chuẩn mạnh mẽ sẽ giúp đo lường tính hữu ích thực tế và độ an toàn của chúng trong việc phát hiện hoặc khắc phục lỗ hổng. CyberGym sở hữu 1.507 lỗ hổng lịch sử được thu thập từ 188 dự án phần mềm lớn, thử nghiệm các mô hình AI trên các tác vụ như tạo mã khai thác thử nghiệm (PoC) và tái dựng lỗ hổng.
## KIẾN THỨC NỀN
Việc đánh giá các Mô hình Ngôn ngữ Lớn (LLM) trong các lĩnh vực chuyên biệt như an ninh mạng đòi hỏi môi trường thực tế thay vì các câu hỏi trắc nghiệm đơn giản. Các tác nhân AI phải tương tác với kho mã nguồn, tái dựng lỗi và viết mã khai thác hoặc bản vá để chứng minh năng lực thực sự.