Zagreus-0.4B-por: Mô hình ngôn ngữ nhỏ nguồn mở cho tiếng Bồ Đào Nha và tiếng Anh
Phòng nghiên cứu AI nguồn mở mii-llm đã phát hành Zagreus-0.4B-por, một mô hình ngôn ngữ song ngữ Bồ Đào Nha - Anh nhỏ gọn với 400 triệu tham số được huấn luyện trước từ đầu. Mô hình này vượt trội hơn mô hình Qwen3-0.6B-Base lớn hơn trên các bài kiểm tra đánh giá tiếng Bồ Đào Nha, đạt điểm số 0,3230 so với 0,2569 của Qwen3. Điều này chứng minh tính khả thi của việc huấn luyện các mô hình ngôn ngữ nhỏ (SLM) hiệu quả cao cho các ngôn ngữ không phải tiếng Anh, giúp AI dễ tiếp cận hơn trên các thiết bị biên và thiết bị cá nhân. Nó cũng cung cấp một nền tảng có thể tùy chỉnh cho các nhà nghiên cứu và nhà phát triển tập trung vào xử lý ngôn ngữ tự nhiên (NLP) tiếng Bồ Đào Nha. Mô hình được huấn luyện trên các tập dữ liệu mở bao gồm FineWeb Portuguese, FineWeb2 Portuguese, FinePDFs và StarCoderData, với tài nguyên tính toán được tài trợ bởi Seeweb và Regolo.ai. Đây là một mô hình nền tảng được phát hành nhằm mục đích tinh chỉnh hướng dẫn (instruction tuning) và nghiên cứu sâu hơn, thay vì là một trợ lý hoàn thiện.
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ nhỏ (SLM) ngày càng phổ biến vì chúng đòi hỏi ít tài nguyên tính toán hơn để vận hành, cho phép triển khai trực tiếp trên thiết bị. Các bài đánh giá tiêu chuẩn như ARC, HellaSwag và MMLU, thường được chạy qua các khung kiểm thử như LM Evaluation Harness của EleutherAI, là những công cụ tiêu chuẩn được sử dụng để đo lường khả năng lập luận, kiến thức và hiểu ngôn ngữ của mô hình.