~/TECH POLICY/reddit-advances-lawsuit-accusing-perplexity-ai-of-conspiring-with-web-scraper

Reddit tiếp tục vụ kiện cáo buộc Perplexity AI bắt tay với bên thu thập dữ liệu

Reddit đang đẩy mạnh vụ kiện cáo buộc Perplexity AI đồng lõa với một bên thu thập dữ liệu web để vượt qua các biện pháp chặn quét dữ liệu của mình. Vụ kiện cáo buộc rằng sự hợp tác này nhằm mục đích truy cập trái phép vào nội dung của Reddit bất chấp các hạn chế. Vụ kiện này có thể tạo ra một tiền lệ pháp lý quan trọng về cách các công ty AI tiếp cận dữ liệu huấn luyện và liệu việc vượt qua các rào cản chặn quét web có cấu thành hành vi vi phạm pháp luật hay không. Nó làm nổi bật căng thẳng ngày càng tăng giữa các nền t nền tảng nội dung muốn bảo vệ dữ liệu và các công ty AI đang tìm kiếm thông tin. Reddit tuyên bố bên thu thập dữ liệu đã phối hợp với Perplexity AI để lách các lệnh chặn của họ, ngay cả sau khi Google thua trong một cuộc chiến pháp lý liên quan. Trước đó, Perplexity AI cũng từng bị nhiều tổ chức truyền thông lớn giám sát vì cáo buộc sử dụng các trình thu thập dữ liệu ẩn danh để vượt qua các hạn chế của tệp robots.txt.

## KIẾN THỨC NỀN

Thu thập dữ liệu web (web scraping) là kỹ thuật được sử dụng để trích xuất dữ liệu từ các trang web, vốn là nguồn tài nguyên mà các công ty AI thường dựa vào để huấn luyện các mô hình ngôn ngữ lớn. Các trang web thường sử dụng giao thức robots.txt để báo hiệu cho các trình thu thập dữ liệu biết phần nào của trang web không được phép truy cập. Tuy nhiên, việc tuân thủ robots.txt là tự nguyện, dẫn đến các tranh chấp khi các công ty AI hoặc bên quét dữ liệu phớt lờ các chỉ thị này.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Tech Policy#Web Scraping#Artificial Intelligence#Reddit#Perplexity AI

$ subscribe --daily

Reddit tiếp tục vụ kiện cáo buộc Perplexity AI bắt tay với bên thu thập dữ liệu | Daily News