OpenAI có thể dùng token suy luận ẩn của người dùng để huấn luyện
Phân tích về chính sách bảo mật của OpenAI cho thấy cam kết từ chối (opt-out) dữ liệu huấn luyện của người dùng trả phí có thể chỉ áp dụng cho kết quả đầu ra cuối cùng, bỏ ngỏ các token suy luận nội bộ. Vì các chuỗi suy luận ẩn này chứa thông tin xử lý trung gian của prompt và phản hồi, OpenAI về mặt lý thuyết có thể thu thập chúng để huấn luyện mô hình ngay cả khi người dùng đã đăng ký opt-out. Nếu nhận định pháp lý này đúng, các cá nhân và tổ chức chú trọng bảo mật sử dụng mô hình suy luận của OpenAI (như o1 hay o3) có thể vô tình để lộ dữ liệu nhạy cảm cho các quy trình tiền huấn luyện hoặc tạo dữ liệu tổng hợp trong tương lai. Điều này phản ánh khoảng trống trong điều khoản bảo mật AI, khi các đầu ra trung gian không hiển thị cho người dùng lại nằm ngoài phạm vi cam kết sở hữu dữ liệu. Khác với điều khoản API của OpenAI hay chính sách của Anthropic (vốn bảo vệ nội dung tạo ra bất kể người dùng có trực tiếp nhận được hay không), điều khoản ChatGPT dành cho người tiêu dùng của OpenAI liên kết quyền sở hữu và quy tắc opt-out với đầu ra nhận được bởi người dùng. Do đó, các token chuỗi suy luận (CoT) không được trả về có thể bị đưa vào dữ liệu midtraining hoặc dữ liệu huấn luyện tổng hợp mà không vi phạm cam kết hợp đồng hiện tại.
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ lớn (LLM) suy luận sử dụng cơ chế chuỗi suy luận (Chain-of-Thought - CoT) ẩn để giải quyết vấn đề nhiều bước trước khi đưa ra câu trả lời cuối cùng cho người dùng. Midtraining là giai đoạn học máy trung gian nằm giữa quá trình tiền huấn luyện tổng quát và canh chỉnh sau huấn luyện, dùng để pha trộn các tập dữ liệu chuyên biệt vào mô hình. Hầu hết các gói dịch vụ AI trả phí đều cung cấp tùy chọn opt-out nhằm ngăn các cuộc trò chuyện cá nhân bị tái sử dụng để huấn luyện mô hình tương lai.