Ornith-1.5: Dòng mô hình ngôn ngữ lớn mã nguồn mở mới cho suy luận và lập trình
Ornith-1.5 vừa được ra mắt dưới dạng một dòng mô hình ngôn ngữ lớn (LLM) mã nguồn mở mới, bao gồm mô hình 9B Dense, 35B MoE và 397B MoE. Các mô hình này được huấn luyện bằng các chiến lược tự cải thiện (self-improving) và đạt hiệu suất cạnh tranh trong các tác vụ suy luận, tác nhân (agentic) và lập trình. Sự ra mắt này cung cấp cho cộng đồng mã nguồn mở các mô hình có năng lực cao, cạnh tranh trực tiếp với các hệ thống độc quyền như Claude Opus 4.8 trên các bài kiểm tra phức tạp. Nó chứng minh tính khả thi của các chiến lược huấn luyện tự cải thiện trong việc mở rộng hiệu suất mô hình ở nhiều quy mô khác nhau. Ornith-1.5 đạt điểm số cao trên các bài kiểm tra nâng cao, bao gồm 56 điểm trên DeepSWE, 86,1 điểm trên Terminal-Bench 2.1 và 86 điểm trên SWE-Bench (bản verified). Các mô hình này được lưu trữ trên Hugging Face thuộc bộ sưu tập của Ornith-AI.
## KIẾN THỨC NỀN
Việc đánh giá các LLM tiên tiến ngày càng trở nên khó khăn khi các bài kiểm tra truyền thống dần bị bão hòa. Các bài kiểm tra mới hơn như DeepSWE tập trung vào các tác vụ kỹ thuật phần mềm dài hạn (long-horizon), trong khi Terminal-Bench và ClawEval đánh giá các quy trình làm việc của tác nhân trong môi trường dòng lệnh thực tế và các vai trò công việc thực tiễn.