Hugging Face phát hành The Stack v3, bộ dữ liệu mã nguồn mở lớn nhất
Hugging Face và BigCode đã phát hành The Stack v3, một bộ dữ liệu khổng lồ chứa khoảng 5 nghìn tỷ token được tinh lọc từ 114 TB dữ liệu thu thập trên GitHub. Bộ dữ liệu này có sẵn dưới dạng tập dữ liệu huấn luyện 30 TB đã qua lọc trước với nội dung tích hợp trực tiếp (inline), cùng với một tập dữ liệu thô đầy đủ dung lượng 114 TB. Bản phát hành này cung cấp một tài nguyên nền tảng để huấn luyện các mô hình ngôn ngữ lớn (LLM) chuyên về mã nguồn thế hệ tiếp theo. Bằng cách tích hợp trực tiếp nội dung mã nguồn (inline), nó giải quyết một vấn đề lớn về trải nghiệm người dùng từ phiên bản trước khi người dùng gặp khó khăn trong việc truy cập mã nguồn thực tế. Bộ dữ liệu này bao gồm 770 ngôn ngữ lập trình và 224 triệu kho lưu trữ (repository), với phiên bản đầy đủ được lưu trữ trên Hugging Face Storage Buckets để cho phép người dùng tự tùy chỉnh bộ lọc và loại bỏ trùng lặp. Phiên bản huấn luyện đã được lọc chất lượng, loại bỏ gần như toàn bộ trùng lặp và ẩn các thông tin nhận dạng cá nhân (PII).
## KIẾN THỨC NỀN
The Stack là một bộ dữ liệu tiền huấn luyện nổi bật được sử dụng để xây dựng các LLM về mã nguồn cho các tác vụ như hoàn thành mã, tạo tài liệu và tự động điền mã. Hugging Face Storage Buckets cung cấp giải pháp lưu trữ đối tượng tương tự S3 được hỗ trợ bởi backend Xet, tối ưu hóa cho việc lưu trữ các tệp dữ liệu khổng lồ vốn quá lớn đối với các kho lưu trữ Git truyền thống.