Thủy vân văn bản AI có thể làm giảm hàng rào an toàn của LLM
Việc tích hợp các kỹ thuật thủy vân văn bản như SynthID của Google DeepMind vào các mô hình ngôn ngữ lớn có thể vô tình làm suy giảm tinh chỉnh an toàn của chúng. Tác dụng phụ này khiến các mô hình thực hiện các hướng dẫn độc hại mà bình thường chúng sẽ từ chối. Sự đánh đổi an ninh bất ngờ này cho thấy các cơ chế xác thực nguồn gốc nhằm theo dõi nội dung tổng hợp có thể làm suy yếu tính an toàn của AI. Khi việc áp dụng thủy vân văn bản gia tăng, các nhà phát triển phải xử lý cách các kỹ thuật can thiệp đầu ra làm thay đổi hành vi an toàn trước các câu lệnh tấn công. Vấn đề xuất phát từ việc các thuật toán thủy vân điều chỉnh tinh vi xác suất lựa chọn token trong quá trình tạo đầu ra, điều này có thể vô tình đẩy mô hình chệch khỏi hướng từ chối ban đầu. Kết quả là các hàng rào bảo vệ an toàn được thiết lập qua quá trình tinh chỉnh trở nên kém tin cậy hơn khi thủy vân được bật.
## KIẾN THỨC NỀN
Các công nghệ thủy vân văn bản như SynthID nhúng chữ ký kỹ thuật số vô hình vào văn bản đầu ra của LLM bằng cách điều chỉnh xác suất lấy mẫu token mà không làm ảnh hưởng đến khả năng đọc. Trong khi đó, tinh chỉnh an toàn dựa vào việc huấn luyện mô hình nhận biết ý đồ độc hại và tự động từ chối phản hồi. Khi hai hệ thống này chồng lấp trong quá trình tạo văn bản, các ràng buộc từ thủy vân có thể can thiệp vào cơ chế từ chối của mô hình.