Các cơ quan truyền thông địa phương Mỹ kiện Microsoft và OpenAI vì vi phạm bản quyền
Các nhà xuất bản báo chí địa phương tại Mỹ, đứng đầu là Emmerich Newspapers, đã đệ đơn kiện Microsoft và OpenAI với cáo buộc tự ý thu thập hàng chục nghìn bài báo có bản quyền để huấn luyện các mô hình AI. Vụ kiện này làm nổi bật áp lực pháp lý ngày càng lớn mà các công ty công nghệ phải đối mặt từ các nhà xuất bản truyền thông liên quan đến quản trị dữ liệu huấn luyện. Nếu tòa án tuyên phán bất lợi cho các đơn vị phát triển AI, các công ty có thể buộc phải thay đổi cách thu thập dữ liệu web và ký kết các hợp đồng bản quyền tốn kém. Các nguyên đơn, bao gồm Emmerich Newspapers và Coopwood Media Group, cáo buộc các công ty công nghệ vượt qua rào cản trả phí (paywall) và vi phạm Đạo luật Bản quyền cũng như Đạo luật Bản quyền Thiên niên kỷ Kỹ thuật số (DMCA). Bên cạnh việc yêu cầu bồi thường thiệt hại, các nhà xuất bản còn xin lệnh cấm buộc Microsoft và OpenAI xóa dữ liệu vi phạm khỏi mô hình.
## KIẾN THỨC NỀN
Việc huấn luyện các mô hình ngôn ngữ lớn đòi hỏi khối lượng dữ liệu văn bản khổng lồ, vốn thường được các công ty công nghệ thu thập bằng cách cào dữ liệu từ các trang tin tức và website công khai. Mặc dù các đơn vị phát triển AI thường cho rằng hành vi này thuộc phạm vi 'sử dụng hợp pháp' (fair use), các nhà xuất bản báo chí lại khẳng định việc dùng bài viết của họ để tạo ra các sản phẩm thương mại tỷ đô mà không xin phép hay trả phí là vi phạm bản quyền.