Sếp Microsoft gọi hành vi cào dữ liệu AI là 'vụ trộm lao động lớn nhất lịch sử'
Các hồ sơ tòa án mới được công bố tiết lộ rằng các lãnh đạo cấp cao của Microsoft và OpenAI từng thừa nhận việc cào dữ liệu web gây tổn hại cho các nhà xuất bản báo chí và có thể kích hoạt một 'vòng xoáy sụp đổ' (doom loop). Các email nội bộ cho thấy giới lãnh đạo coi hành vi này là vụ trộm lao động trí óc quy mô lớn, đồng thời thừa nhận việc cào nội dung trả phí đang đe doạ ngành báo chí. Những thừa nhận nội bộ này làm suy yếu đáng kể lập luận công khai từ các công ty AI rằng việc sử dụng nội dung báo chí là hợp pháp (fair use), tạo lợi thế lớn cho các vụ kiện bản quyền đang diễn ra. Điều này cũng làm nổi bật một mối đe dọa hệ thống cốt lõi: việc cào dữ liệu AI có nguy cơ phá hủy chính hệ sinh thái sáng tạo nội dung cần thiết để huấn luyện các mô hình AI trong tương lai. Các email này xuất hiện từ các cuộc tranh chấp pháp lý đang diễn ra giữa các tổ chức tin tức lớn với Microsoft và OpenAI về việc cào các bài báo trả phí mà không được phép. Thảo luận của cấp quản lý đã cảnh báo cụ thể rằng việc tước đoạt lượng truy cập và doanh thu của các cơ quan báo chí tạo ra một vòng lặp tiêu cực, khiến ngày càng ít tác phẩm gốc chất lượng cao được sản xuất để các mô hình AI học hỏi.
## KIẾN THỨC NỀN
Các hệ thống AI tạo sinh phụ thuộc vào các tập dữ liệu web khổng lồ—được thu thập thông qua quy trình tự động gọi là cào dữ liệu web (web scraping)—để huấn luyện các mô hình ngôn ngữ và đa phương thức. Nhiều nhà xuất bản đã kiện các công ty phát triển AI hàng đầu, cáo buộc việc cào bài viết có bản quyền mà không bồi thường hay xin phép là vi phạm quyền sở hữu trí tuệ. Khái niệm 'vòng xoáy sụp đổ' (doom loop) trong ngành báo chí mô tả một chu kỳ mà công cụ AI trả lời câu hỏi của người dùng bằng cách dùng nội dung cào được, làm sụp đổ doanh thu quảng cáo của nhà xuất bản và cuối cùng làm cạn kiệt nguồn nội dung mới do con người tạo ra cho AI nạp vào.