Claude Được Cho Là Áp Dụng Watermark Ẩn, Gây Lo Ngại Về Lỗi Nhận Diện Sai
Một cuộc thảo luận trên Reddit đã chỉ ra các báo cáo cho thấy mô hình Claude của Anthropic đã chính thức bắt đầu chèn watermark ẩn (steganographic watermarking) vào văn bản do AI tạo ra. Người dùng đã ghi nhận các trường hợp nhận diện sai (false positives), khi văn bản do con người viết hoặc các kết quả không liên quan bị gắn cờ nhầm. Sự phát triển này làm gia tăng cuộc tranh luận giữa các mô hình AI mã nguồn mở và mã nguồn đóng, khi người dùng lo ngại về việc bị theo dõi ngầm và thiếu quyền kiểm soát đối với văn bản đầu ra. Nó cũng làm nổi bật những thách thức kỹ thuật trong việc nhận diện chính xác nội dung do AI tạo ra mà không gây ảnh hưởng đến quy trình làm việc của người dùng hoặc buộc tội oan cho người viết. Kỹ thuật đóng dấu ẩn văn bản (steganographic text watermarking) thường hoạt động bằng cách thay đổi nhẹ phân phối xác suất của các token trong quá trình tạo văn bản, giúp các công cụ phát hiện nhận diện được nhưng người đọc bình thường không thấy. Tuy nhiên, phương pháp này có thể bị vượt qua bằng cách diễn đạt lại (paraphrasing) và có thể dẫn đến lỗi nhận diện sai nếu cách viết tự nhiên của con người vô tình trùng khớp với chữ ký thống kê của watermark.
## KIẾN THỨC NỀN
Đóng dấu ẩn văn bản AI (AI text watermarking) là một kỹ thuật được các nhà phát triển AI sử dụng để nhúng các mẫu thống kê ẩn vào văn bản được tạo ra nhằm chứng minh nguồn gốc nhân tạo của nó. Một phương pháp phổ biến là chia các token từ vựng thành danh sách "xanh" và "đỏ", từ đó điều chỉnh nhẹ để mô hình ưu tiên chọn các token "xanh" trong quá trình tạo văn bản. Mặc dù được thiết kế để chống đạo văn và tin giả, các hệ thống này vẫn đối mặt với nhiều chỉ trích liên quan đến quyền riêng tư của người dùng và độ chính xác của việc phát hiện.