DeepSeek-V4-Flash-0731 Vượt Trội Hơn DeepSeek-V4-Pro-Preview Trong Các Thử Nghiệm Hiệu Năng
Mô hình DeepSeek-V4-Flash-0731 được báo cáo là đã vượt qua mô hình lớn hơn là DeepSeek-V4-Pro-Preview trong các bài kiểm tra hiệu năng. Sự cải thiện hiệu suất này đạt được thông qua quá trình tái đào tạo sau huấn luyện (re-post-training), trong khi vẫn giữ nguyên kiến trúc và kích thước ban đầu của mô hình. Sự phát triển này chứng minh rằng các mô hình nhỏ hơn, tiết kiệm chi phí hơn có thể đạt được hiệu suất vượt trội thông qua các kỹ thuật tối ưu hóa sau huấn luyện. Nó làm nổi bật xu hướng quan trọng của ngành hướng tới hiệu quả của mô hình, cho phép các nhà phát triển tiếp cận các năng lực cấp cao với chi phí thấp hơn nhiều. DeepSeek-V4-Flash-0731 duy trì cấu trúc Mixture-of-Experts (MoE) với tổng số 284 tỷ tham số và 13 tỷ tham số hoạt động, đồng thời có mức giá cạnh tranh là 0,14 USD cho mỗi triệu token đầu vào và 0,28 USD cho mỗi triệu token đầu ra. Cả hai phiên bản Flash và Pro đều hỗ trợ ba chế độ nỗ lực suy luận (reasoning effort modes) để tùy chỉnh hiệu suất.
## KIẾN THỨC NỀN
DeepSeek-V4 là một dòng mô hình ngôn ngữ lớn sử dụng kiến trúc Mixture-of-Experts (MoE), trong đó chỉ một phần nhỏ tham số (tham số hoạt động) được kích hoạt cho mỗi token để tiết kiệm tài nguyên tính toán. Phiên bản 'Pro' là mô hình lớn hơn được thiết kế cho năng lực tối đa, trong khi phiên bản 'Flash' là biến thể nhỏ hơn, nhanh hơn và tiết kiệm chi phí hơn được tối ưu hóa cho tốc độ.