Nhà nghiên cứu cáo buộc OpenAI ngụy tạo tiến bộ bằng dữ liệu trò chuyện
Một nhà nghiên cứu đã công khai cáo buộc OpenAI huấn luyện mô hình trên dữ liệu trò chuyện của người dùng và báo cáo sai rằng sự cải thiện điểm số đánh giá là do các đột phá về phương pháp nghiên cứu. Tuyên bố này gợi ý rằng OpenAI đã biến việc ghi nhớ dữ liệu thành các tiến bộ về thuật toán. Nếu đúng, các cáo buộc này đặt ra câu hỏi nghiêm trọng về tính minh bạch trong việc đánh giá AI và liệu các tiến bộ được báo cáo có phản ánh sáng tạo kỹ thuật thực sự hay không. Điều này làm nổi bật mối lo ngại ngày càng tăng trong ngành về sự nhiễm bẩn dữ liệu đánh giá và tính toàn vẹn của tập dữ liệu trong các LLM thương mại. Vấn đề tập trung vào sự nhiễm bẩn dữ liệu (data contamination), nơi các tương tác của người dùng hoặc câu hỏi đánh giá bị rò rỉ vào tập dữ liệu huấn luyện và làm tăng điểm đánh giá hiệu suất một cách nhân tạo. Tuy nhiên, bài đăng gốc cung cấp rất ít bằng chứng kỹ thuật trực tiếp hoặc phương pháp luận cụ thể để hỗ trợ cáo buộc này.
## KIẾN THỨC NỀN
Nhiễm bẩn dữ liệu (data contamination) trong máy học xảy ra khi các mẫu thử nghiệm hoặc đánh giá vô tình xuất hiện trong tập dữ liệu huấn luyện của mô hình, cho phép mô hình ghi nhớ câu trả lời thay vì suy luận tổng quát. Việc phát hiện sự nhiễm bẩn này trong các mô hình ngôn ngữ lớn (LLM) là cực kỳ thách thức do khối lượng dữ liệu khổng lồ từ web và nhật ký tương tác người dùng được sử dụng trong quá trình huấn luyện.