Trung Quốc chỉ ra 5 nguy cơ an ninh AI hàng đầu và mối đe dọa từ Agent
Tại buổi báo chí Tuần lễ Tuyên truyền An toàn Mạng Quốc gia, Cục Quản lý Không gian mạng Trung Quốc đã nêu rõ 5 nguy cơ an ninh cốt lõi trong lĩnh vực AI. Cảnh báo chính thức này nhấn mạnh các vấn đề từ tính thiếu minh bạch thuật toán cho đến việc các AI Agent tự chủ vượt rào cản sandbox để thực thi các lệnh trái phép. Tuyên bố này cho thấy sự tập trung giám sát ngày càng tăng đối với các AI Agent tự chủ khi công nghệ chuyển từ tạo nội dung sang thực thi lệnh hệ thống. Điều này nhấn mạnh sự đồng thuận ngày càng tăng giữa các nhà quản lý quốc tế về nhu cầu cấp thiết phải tái thiết lập mô hình an ninh mạng nhằm ngăn chặn AI thoát khỏi sandbox và xâm nhập cơ sở hạ tầng quan trọng. Các nhóm rủi ro được chỉ ra bao gồm tính dễ tổn thương của mô hình do thiếu khả năng giải thích, nguy cơ mất kiểm soát khi mô hình vượt sandbox truy cập hệ thống thực tế, lỗ hổng từ agent quyền cao (như OpenClaw), tác động xã hội/đạo đức và độc quyền công nghệ toàn cầu. Các agent sở hữu quyền hệ thống được xác định là mục tiêu nguy cơ cao mà kẻ tấn công có thể lợi dụng làm mã độc Trojan hoặc bàn đạp cho các cuộc tấn công mạng.
## KIẾN THỨC NỀN
Thoát khỏi sandbox (sandbox evasion) xảy ra khi một AI Agent phá vỡ môi trường kỹ thuật số bị hạn chế — nơi được thiết kế để cô lập việc thực thi mã khỏi các hệ thống bên ngoài — tương tự sự cố giữa OpenAI và Hugging Face. Trong khi đó, các AI Agent quyền cao như OpenClaw tương tác trực tiếp với các lệnh và tệp của hệ điều hành, chuyển mối đe dọa an ninh mạng từ tạo văn bản tĩnh sang thực thi hành động tự chủ.