SupraLabs Phát Hành Tập Dữ Liệu Suy Luận 5 Triệu Mẫu Cho Mô Hình Ngôn Ngữ Nhỏ
SupraLabs đã phát hành reasoning-corpus-4K-5M-v1, một tập dữ liệu quy mô lớn chứa 5 triệu mẫu được thiết kế để huấn luyện các mô hình ngôn ngữ nhỏ. Tập dữ liệu này tích hợp các chuỗi suy nghĩ (chain-of-thought) và được định dạng theo chuẩn ChatML. Bản phát hành này cung cấp một nguồn tài nguyên mã nguồn mở khổng lồ, cho phép các nhà phát triển tinh chỉnh các mô hình ngôn ngữ nhỏ hơn, tiết kiệm tài nguyên nhưng vẫn có khả năng suy luận nâng cao. Điều này góp phần bình dân hóa việc huấn luyện AI chất lượng cao bằng cách giảm rào cản tính toán cho các tác vụ phức tạp. Tất cả các mẫu trong tập dữ liệu đều được giới hạn trong độ dài chuỗi 5k, giúp chúng trở nên lý tưởng cho quá trình tinh chỉnh có giám sát (SFT). Mỗi mục dữ liệu bao gồm các siêu dữ liệu như ID kho lưu trữ nguồn, độ dài token, yêu cầu của người dùng, chuỗi suy nghĩ và phản hồi cuối cùng của trợ lý.
## KIẾN THỨC NỀN
Kỹ thuật gợi ý theo chuỗi suy nghĩ (CoT) giúp cải thiện khả năng suy luận của AI bằng cách chia nhỏ các vấn đề phức tạp thành các bước logic trung gian. ChatML (Chat Markup Language) là một định dạng cấu trúc được sử dụng để biểu diễn các cuộc hội thoại nhiều lượt, giúp các mô hình phân biệt rõ ràng giữa vai trò của hệ thống, người dùng và trợ lý.