Các mô hình AI vượt ngưỡng năng lực trong thử nghiệm khai thác mã nhị phân
Đội ngũ Frontier Red Team của Anthropic báo cáo rằng các mô hình AI thế hệ mới bao gồm GLM-5.3 và Claude Mythos Preview đã thực hiện thành công việc chiếm quyền kiểm soát luồng thực thi (control flow hijack) trong các bài kiểm tra khai thác mã nhị phân. Điều này đánh dấu một bước chuyển dịch năng lực đáng chú ý, vì các mô hình thế hệ trước như Claude Opus 4.6 và GLM-5.2 đều không đạt được thành công nào trên cùng bộ thử nghiệm. Cột mốc này chứng minh rằng các mô hình ngôn ngữ lớn (LLM) tiên tiến đang dần có được năng lực tấn công mạng tự động ở mức độ sâu trong mã máy. Điều này nhấn mạnh sự cần thiết cấp bách của thử nghiệm an toàn AI và red teaming chủ động nhằm đánh giá rủi ro trước khi triển khai các mô hình hàng đầu. Trong 100 tác vụ khai thác mã nhị phân thử nghiệm, Claude Mythos Preview đạt tỷ lệ chiếm quyền kiểm soát luồng thành công ở mức 6% số lần thử, trong khi GLM-5.3 đạt 4%. Các mô hình thế hệ trước đó đều thất bại 100%, cho thấy một bước nhảy vọt rõ rệt về năng lực khai thác lỗ hổng.
## KIẾN THỨC NỀN
Khai thác mã nhị phân (binary exploitation) là việc lợi dụng các lỗ hổng bộ nhớ trong phần mềm đã biên dịch để làm sai lệch trạng thái thực thi và chiếm quyền kiểm soát. Chiếm quyền kiểm soát luồng thực thi (control flow hijack) cho phép kẻ tấn công thay đổi luồng lệnh dự kiến của chương trình để chạy các mã không mong muốn. Red teaming trong AI ứng dụng các phương pháp kiểm thử xâm nhập an ninh mạng để đánh giá rủi ro và các năng lực nguy hiểm tiềm ẩn của mô hình học máy.