Trung Quốc phát hành Bộ dữ liệu cơ bản Internet tiếng Trung 4.0 dung lượng 120GB
Hiệp hội An ninh Không gian mạng Trung Quốc đã chính thức phát hành Bộ dữ liệu cơ bản Internet tiếng Trung 4.0, cung cấp 120GB dữ liệu đáng tin cậy phục vụ huấn luyện trí tuệ nhân tạo và các mô hình ngôn ngữ lớn. Được phát triển dưới sự chỉ đạo của Cục Quản lý Không gian mạng Trung Quốc, bộ dữ liệu này là kết quả hợp tác với các đơn vị lớn như Baidu, iFlytek và Zhihu. Các bộ dữ liệu văn bản tiếng Trung chất lượng cao và được kiểm duyệt đóng vai trò quan trọng trong việc thu hẹp khoảng cách dữ liệu giữa hệ sinh thái huấn luyện LLM tiếng Trung và tiếng Anh. Bằng cách mở rộng nguồn cung dữ liệu xác thực công khai, sáng kiến này giúp thiết lập nền tảng dữ liệu chuẩn hóa cho việc phát triển và đảm bảo an toàn AI trong nước. Bộ dữ liệu 120GB có thể truy cập thông qua Nền tảng Tài nguyên Dữ liệu Internet tiếng Trung sau khi hoàn tất các thủ tục đăng ký và xác minh người dùng. Tập dữ liệu đã trải qua các quy trình xử lý và lọc trùng lặp nghiêm ngặt để tổng hợp dữ liệu từ các doanh nghiệp công nghệ và viện nghiên cứu tham gia.
## KIẾN THỨC NỀN
Việc huấn luyện các mô hình ngôn ngữ lớn hiệu quả đòi hỏi nguồn dữ liệu văn bản khổng lồ đã qua xử lý để ngăn chặn các vấn đề như nội dung độc hại hoặc hiện tượng ảo giác của mô hình. Để giải quyết sự thiếu hụt dữ liệu trong lĩnh vực NLP tiếng Trung, các cơ quan an ninh mạng và doanh nghiệp hàng đầu Trung Quốc đã thành lập cơ chế hợp tác xây dựng và chia sẻ dữ liệu Internet. Các phiên bản trước (từ 1.0 đến 3.0) đã dần hoàn thiện nguồn tài nguyên công cộng này nhằm cung cấp dữ liệu tiền huấn luyện đáng tin cậy cho các nhà nghiên cứu AI.