ISBNdb gỡ trang quảng cáo AI sau làn sóng phản đối việc hủy sách để quét dữ liệu
Cơ sở dữ liệu sách ISBNdb đã gỡ bỏ một trang tiếp thị liên quan đến AI sau làn sóng phản đối dữ dội từ công chúng trước thông tin các công ty AI mua và tiêu hủy sách vật lý để số hóa làm dữ liệu huấn luyện. Nền tảng này làm rõ rằng họ không tự huấn luyện các mô hình AI và trang web đó chỉ là một thử nghiệm nhu cầu thị trường. Tranh cãi này làm nổi bật các chiến lược thu thập dữ liệu quyết liệt và gây tranh cãi về mặt đạo đức của các công ty AI nhằm tìm kiếm dữ liệu huấn luyện chất lượng cao, tránh hiện tượng sụp đổ mô hình do nội dung rác trên web. Nó cũng nhấn mạnh những kẽ hở pháp lý và đạo đức trong luật bản quyền liên quan đến việc tiêu hủy vật lý và số hóa các tác phẩm có bản quyền. Phương pháp "quét hủy diệt" (destructive scanning)—cắt bỏ gáy sách để số hóa tốc độ cao với chi phí thấp—trước đó đã bị lộ trong dự án bí mật "Project Panama" của Anthropic, hành vi mà một thẩm phán liên bang phán quyết là hợp pháp. Trang web đã bị xóa của ISBNdb từng quảng cáo rằng sách vật lý chứa đựng tri thức có cấu trúc và đã qua bình duyệt mà các công cụ thu thập dữ liệu web không thể sao chép được.
## KIẾN THỨC NỀN
ISBNdb là một cơ sở dữ liệu thư mục trực tuyến toàn diện, tổng hợp siêu dữ liệu về sách trên toàn thế giới, bao gồm tiêu đề, tác giả và nhà xuất bản. Khi các công ty AI cạn kiệt dữ liệu web dễ tiếp cận, họ đối mặt với nguy cơ "sụp đổ mô hình" do huấn luyện trên nội dung do AI tạo ra, buộc họ phải tìm kiếm các nguồn ngoại tuyến chất lượng cao như sách đã xuất bản. Dự án "Project Panama" của Anthropic là một ví dụ điển hình, trong đó hàng triệu cuốn sách cũ đã được mua, cắt bỏ gáy và quét để huấn luyện chatbot Claude.