Tranh luận về việc liệu hiệu năng của LLM Trung Quốc có chủ yếu nhờ chắt lọc tri thức
Một cuộc thảo luận trong cộng đồng AI đang thách thức tuyên bố rằng các mô hình ngôn ngữ lớn (LLM) của Trung Quốc đạt hiệu năng cao chủ yếu nhờ chắt lọc tri thức từ các mô hình hàng đầu của phương Tây. Tác giả lập luận rằng chắt lọc tri thức không phải là một con đường tắt đơn giản để sao chép các khả năng hàng đầu, đồng thời chỉ ra sự khác biệt về phong cách và việc sử dụng rộng rãi dữ liệu AI thu thập từ web. Việc hiểu rõ các yếu tố thực sự thúc đẩy hiệu năng của LLM là rất quan trọng để đánh giá động lực cạnh tranh giữa các phòng thí nghiệm AI toàn cầu và hiệu quả của việc phát triển mã nguồn mở. Nếu chắt lọc tri thức không phải là yếu tố thúc đẩy chính, điều đó cho thấy các phòng thí nghiệm Trung Quốc đang có những tiến bộ độc lập đáng kể trong phương pháp huấn luyện và xử lý dữ liệu. Tác giả lưu ý rằng nếu việc chắt lọc tri thức có thể dễ dàng vượt qua các rào cản độc quyền, nhiều công ty toàn cầu có nguồn lực mạnh đáng lẽ đã bắt kịp các mô hình hàng đầu. Ngoài ra, sự gia tăng của nội dung do AI tạo ra trên mạng đồng nghĩa với việc tất cả các mô hình đều không tránh khỏi việc được huấn luyện trên dữ liệu tổng hợp, làm mờ đi ranh giới của việc chắt lọc trực tiếp.
## KIẾN THỨC NỀN
Chắt lọc tri thức (knowledge distillation) trong AI là kỹ thuật huấn luyện một mô hình 'học sinh' nhỏ hơn, hiệu quả hơn bằng cách sử dụng đầu ra của một mô hình 'giáo viên' lớn hơn, mạnh hơn để bắt chước hiệu năng của nó. Độ hỗn loạn (perplexity) và độ hỗn loạn chéo (cross-perplexity) là các chỉ số được sử dụng để đánh giá các mô hình ngôn ngữ bằng cách đo lường mức độ văn bản được dự đoán khớp với phân phối xác suất hoặc phong cách của mô hình.