~/LLMS/upstage-releases-solar-open-2-matching-deepseek-v4-flash-performance

Upstage Ra Mắt Solar Open 2, Đạt Hiệu Suất Ngang Ngửa DeepSeek-V4-Flash

Upstage đã phát hành "Solar open2", một mô hình ngôn ngữ lớn nguồn mở mới thể hiện hiệu suất cạnh tranh với DeepSeek-V4-Flash. Mô hình này cho thấy khả năng mạnh mẽ trên các bài kiểm tra đánh giá nâng cao về lập luận, lập trình và tác vụ tự trị (agentic). Sự ra mắt này củng cố hệ sinh thái AI nguồn mở bằng cách cung cấp một giải pháp thay thế có năng lực cao cho các mô hình độc quyền và mô hình mở hàng đầu trong lập luận phức tạp và kỹ nghệ phần mềm. Nó làm nổi bật sự tiến bộ nhanh chóng của các mô hình nguồn mở trong việc bắt kịp hiệu suất tiên tiến trên các bài kiểm tra chuyên biệt. Solar Open 2 (250B-A15B) đạt điểm số 86,3 trên GPQA-Diamond và 70,4% trên SWE-Bench Verified, bám sát điểm số của DeepSeek-V4-Flash lần lượt là 88,9 và 73,8%. Ngoài ra, mô hình này cũng đạt điểm số ngang bằng với DeepSeek-V4-Flash trên bài kiểm tra sử dụng công cụ MCP-Atlas với 58,2 điểm.

## KIẾN THỨC NỀN

Việc đánh giá các mô hình ngôn ngữ lớn (LLM) tiên tiến đòi hỏi các bài kiểm tra chuyên biệt như GPQA-Diamond cho lập luận khoa học cấp độ sau đại học, SWE-Bench Verified cho các tác vụ kỹ nghệ phần mềm thực tế, và MCP-Atlas cho năng lực sử dụng công cụ thông qua Giao thức Bối cảnh Mô hình (Model Context Protocol). Các bài kiểm tra này giúp đo lường khả năng hoạt động như một tác nhân tự trị của mô hình thay vì chỉ là một bộ dự đoán văn bản.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLMs#Open Source AI#Model Release#Benchmarks

$ subscribe --daily