Anthropic dàn xếp bản quyền 1,5 tỷ USD giữa cáo buộc nhắm vào mô hình cục bộ
Anthropic liên quan đến một thỏa thuận dàn xếp bản quyền mang tính lịch sử trị giá 1,5 tỷ USD, đánh dấu mức bồi thường lớn nhất được ghi nhận trong một vụ kiện bản quyền tại Mỹ. Trong khi đó, công ty này lại đối mặt với chỉ trích khi khiếu nại rằng các mô hình nguồn mở cục bộ đang đánh cắp dữ liệu của họ. Thỏa thuận khổng lồ này tạo ra một tiền lệ quan trọng cho luật bản quyền AI và làm nổi bật sự căng thẳng giữa các ông lớn AI độc quyền với cộng đồng nguồn mở. Nó phơi bày một tiêu chuẩn kép khi các công ty AI thương mại sử dụng dữ liệu có bản quyền để huấn luyện nhưng lại phản đối khi các mô hình cục bộ chắt lọc tri thức từ họ. Mặc dù thỏa thuận dàn xếp trị giá 1,5 tỷ USD giải quyết phần lớn tranh chấp, một số tác giả và nhà xuất bản đã chọn rút khỏi thỏa thuận để tiếp tục các vụ kiện riêng rẽ chống lại Anthropic. Tranh cãi này cũng tập trung vào việc các mô hình cục bộ sử dụng đầu ra từ các mô hình độc quyền như Claude để huấn luyện, một quy trình được gọi là chắt lọc tri thức (knowledge distillation).
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ lớn (LLM) thường được huấn luyện trên các tập dữ liệu khổng lồ, dẫn đến các vụ kiện bản quyền từ những nhà sáng tạo cáo buộc tác phẩm của họ bị sử dụng không phép. Ngoài ra, các LLM nguồn mở hoặc cục bộ đôi khi cải thiện hiệu suất thông qua phương pháp chắt lọc tri thức (knowledge distillation), một kỹ thuật huấn luyện mô hình học sinh nhỏ hơn bắt chước đầu ra của mô hình giáo viên độc quyền lớn hơn.