~/LARGE LANGUA/debate-over-llms-relying-on-proprietary-data-rather-than-proprietary-technology

Tranh luận về việc LLM phụ thuộc vào dữ liệu độc quyền thay vì công nghệ độc quyền

Một cuộc thảo luận trên Reddit nhấn mạnh lập luận rằng các mô hình ngôn ngữ lớn (LLM) không phụ thuộc vào công nghệ độc quyền, mà thay vào đó được xây dựng bằng cách huấn luyện trên lượng lớn dữ liệu độc quyền và có khả năng bị vi phạm bản quyền. Điều này đề cập đến các cuộc tranh luận pháp lý và đạo đức đang diễn ra xung quanh việc huấn luyện AI, nơi giá trị cốt lõi của LLM được cho là đến từ tài sản trí tuệ được thu thập hơn là các thuật toán mới. Nó có thể ảnh hưởng đến các quy định bản quyền tương lai và mô hình cấp phép dữ liệu cho các công ty AI. Lập luận chỉ ra rằng kiến trúc Transformer nền tảng được chia sẻ rộng rãi và công khai, nghĩa là lợi thế cạnh tranh của các LLM thương mại hầu như nằm hoàn toàn ở quy mô và chất lượng của dữ liệu huấn luyện được thu thập.

## KIẾN THỨC NỀN

Các LLM hiện đại được xây dựng trên kiến trúc Transformer, sử dụng cơ chế tự chú ý (self-attention) để xử lý dữ liệu song song. Để huấn luyện các mô hình này, các nhà phát triển thu thập lượng lớn dữ liệu văn bản từ web thông qua việc cào dữ liệu, tiền xử lý và mã hóa (tokenization).

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Large Language Models#Intellectual Property#AI Ethics#Copyright

$ subscribe --daily

Tranh luận về việc LLM phụ thuộc vào dữ liệu độc quyền thay vì công nghệ độc quyền | Daily News