Unbounded Labs Ra Mắt Bart, Mô Hình LLM Cổ Điển 2,82 Tỷ Tham Số
Unbounded Labs đã phát hành Bart, một mô hình ngôn ngữ lớn với 2,82 tỷ tham số được huấn luyện từ đầu trên 20,1 tỷ token văn bản tiếng Anh được viết trước năm 1931. Dự án này nhằm nghiên cứu xem liệu các mô hình AI có thể tạo ra các ý tưởng khoa học độc đáo mà không cần tiếp cận với dữ liệu huấn luyện hiện đại hay không. Thử nghiệm này kiểm tra giới hạn về tính nguyên bản và khả năng khám phá khoa học của AI bằng cách cô lập mô hình khỏi các khái niệm hiện đại, giúp các nhà nghiên cứu hiểu liệu LLM có thể tư duy độc lập hay không. Ngoài ra, việc phát hành các bộ đánh giá tiêu chuẩn (benchmark) tùy chỉnh và tập dữ liệu lịch sử sẽ cung cấp các công cụ mới để nghiên cứu khả năng khái quát hóa và lập luận lịch sử của mô hình. Mô hình được huấn luyện chỉ trong năm ngày trên một GPU Nvidia H100 duy nhất với chi phí khoảng 807 USD, duy trì hiệu suất sử dụng phần cứng (MFU) ở mức 60%. Nhóm nghiên cứu cũng đã phát hành "Vintage CORE", một bộ gồm 20 bài đánh giá tiêu chuẩn, cùng một tập dữ liệu tinh chỉnh có giám sát (SFT) chứa 416.000 cặp câu hỏi và trả lời được chấm điểm dựa trên văn bản trước những năm 1930.
## KIẾN THỨC NỀN
Việc huấn luyện các mô hình ngôn ngữ trên dữ liệu lịch sử (thường được gọi là LLM "cổ điển") giúp các nhà nghiên cứu đánh giá AI mà không gặp rủi ro rò rỉ dữ liệu đánh giá (benchmark contamination), hiện tượng mô hình hoạt động tốt chỉ vì chúng đã ghi nhớ các câu trả lời thử nghiệm từ internet hiện đại. Phương pháp này cũng cho phép các nhà khoa học khám phá xem liệu AI có thể tái tạo các đột phá khoa học hiện đại, chẳng hạn như thuyết tương đối rộng, chỉ bằng cách sử dụng kiến thức nền tảng có sẵn cho các nhà khoa học ở thời kỳ trước đó hay không.