Phát hiện lỗ hổng sâu AI tự nhân bản trong Microsoft Copilot cho Word
Nhà nghiên cứu bảo mật Håkon Måløy đã trình diễn một lỗ hổng chèn lệnh (prompt injection) trong Microsoft Copilot cho Word, cho phép các chỉ dẫn ẩn tự nhân bản qua các tài liệu và hoạt động như một con sâu AI. Mặc dù đã được báo cáo bảo mật có trách nhiệm cho Microsoft, hiện vẫn chưa có biện pháp khắc phục triệt để nào được triển khai sau 144 ngày. Lỗ hổng này làm nổi bật một nguy cơ mới khi các cuộc tấn công chèn lệnh gián tiếp có thể bị vũ khí hóa thành mã độc tự lan truyền trong quy trình xử lý tài liệu của doanh nghiệp. Nó chứng minh rằng các công cụ năng suất tích hợp LLM có thể vô tình trở thành vector phát tán các chỉ dẫn độc hại mà không cần sự can thiệp trực tiếp của kẻ tấn công. Cuộc tấn công hoạt động bằng cách nhúng các chỉ dẫn ẩn vào tài liệu nguồn mà Copilot sau đó sao chép vào các bản thảo mới, biến chúng thành vật mang mầm bệnh mới để tiếp tục lan truyền khi được xử lý trong các quy trình tiếp theo. Lỗ hổng này khai thác việc LLM không thể phân biệt giữa dữ liệu và chỉ dẫn lệnh, cho phép văn bản ẩn thao túng quá trình tạo tài liệu.
## KIẾN THỨC NỀN
Chèn lệnh (prompt injection) là một lỗ hổng bảo mật mà kẻ tấn công thao túng Mô hình Ngôn ngữ Lớn (LLM) bằng cách cung cấp các đầu vào ghi đè lên các chỉ dẫn hệ thống ban đầu của nó. Trong chèn lệnh gián tiếp, các chỉ dẫn độc hại này được đặt trong các nguồn dữ liệu bên ngoài, chẳng hạn như tài liệu hoặc trang web mà LLM truy xuất và xử lý. Điều này khiến mô hình thực hiện các hành động ngoài ý muốn vì nó không thể phân biệt giữa chỉ dẫn của nhà phát triển và dữ liệu bên ngoài.