Aurora1.0-150M ra mắt: Mô hình ngôn ngữ nguồn mở 150 triệu tham số
Mô hình ngôn ngữ nguồn mở Aurora1.0-150M với 150 triệu tham số vừa được phát hành sau khi được huấn luyện trên 7 tỷ token bằng một GPU RTX Pro 6000. Mô hình đạt hiệu suất tương đương với GPT-2 Small và đi kèm mã nguồn suy luận trên Hugging Face. Dự án này cho thấy các nhà phát triển độc lập có thể tự huấn luyện các mô hình ngôn ngữ nhỏ trên phần cứng cá nhân. Tuy nhiên, việc so sánh hiệu suất với mô hình thế hệ cũ như GPT-2 Small cho thấy tiêu chuẩn của các mô hình siêu nhỏ hiện đại đã tiến xa hơn nhiều. Aurora1.0-150M đạt điểm kiểm thử 62,24% trên PIQA, 32,20% trên HellaSwag và 44,91% trên ARC-Easy. Dù nhẹ và dễ chạy cục bộ, kết quả đánh giá của nó vẫn khiêm tốn so với các kiến trúc nhỏ hiện đại được huấn luyện trên dữ liệu lớn hơn.
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ nhỏ (SLM) dưới 1 tỷ tham số được thiết kế để chạy cục bộ trên các thiết bị tiết kiệm tài nguyên như máy tính cá nhân hoặc thiết bị biên. Các bộ kiểm thử chuẩn như PIQA đo lường khả năng suy luận thực tế, trong khi ARC và HellaSwag đánh giá suy luận tổng quát. Mô hình GPT-2 Small của OpenAI, ra mắt năm 2019 với 117 triệu tham số, thường được dùng làm điểm tham chiếu lịch sử cho các mô hình cùng quy mô.