Giáo sư Mỹ bắt quả tang 32 sinh viên gian lận bằng prompt ẩn
Jason Gibson, một giáo sư lịch sử tại Đại học Tiểu bang Alcorn, đã bắt quả tang thành công 32 trên tổng số 35 sinh viên gian lận bằng cách nhúng các câu lệnh (prompt) ẩn bằng chữ màu trắng vào đề thi giữa kỳ. Các hướng dẫn ẩn này đã buộc các công cụ AI phải tạo ra những câu văn kỳ lạ, vô nghĩa về Madagascar, vốn được sinh viên sao chép trực tiếp vào bài làm của mình. Sự việc này làm nổi bật thách thức ngày càng lớn đối với tính trung thực trong học thuật trong kỷ nguyên AI tạo sinh, đồng thời chứng minh một ứng dụng thực tế, ít tốn công nghệ của kỹ thuật chèn câu lệnh (prompt injection) để phát hiện việc sử dụng AI trái phép. Nó cũng nhấn mạnh việc phụ thuộc mù quáng vào kết quả đầu ra của AI mà không kiểm tra lại có thể dễ dàng làm lộ hành vi gian lận học thuật. Câu lệnh ẩn đã hướng dẫn AI mô tả Madagascar theo cách phi logic, dẫn đến các cụm từ như "Madagascar trôi ngang vào buổi chiều" xuất hiện trong bài luận của sinh viên. Trong số 32 sinh viên bị bắt quả tang, 30 người đã thừa nhận gian lận, trong khi hai người cố gắng bào chữa cho hành vi của mình.
## KIẾN THỨC NỀN
Chèn câu lệnh (prompt injection) là một lỗ hổng bảo mật khi các mô hình học máy, đặc biệt là các Mô hình Ngôn ngữ Lớn (LLM), bị thao túng bởi các đầu vào đối nghịch để bỏ qua các hướng dẫn ban đầu và thực hiện các hành động ngoài ý muốn. Trong trường hợp này, vị giáo sư đã sử dụng một dạng chèn câu lệnh gián tiếp (indirect prompt injection), nhúng các hướng dẫn bằng chữ màu trắng vào trong tài liệu, khiến mắt người không nhìn thấy được nhưng lại đọc được khi sao chép và dán vào LLM.