~/LLMS/deepseek-claims-v4-flash-matches-sonnet-5-and-grok-4-5-on

DeepSeek Tuyên Bố V4 Flash Đạt Điểm Ngang Ngửa Sonnet 5 Và Grok 4.5 Trên DeepSWE

DeepSeek tuyên bố rằng mô hình DeepSeek-V4-Flash mới ra mắt của họ có hiệu suất ngang ngửa với các mô hình thế hệ tiếp theo như Sonnet 5 và Grok 4.5 trên bài kiểm tra đánh giá kỹ thuật phần mềm DeepSWE. Tuy nhiên, kết quả tự báo cáo này hiện vẫn chưa được xác minh chính thức bởi những người sáng lập benchmark DeepSWE. Nếu được xác minh, điều này cho thấy các mô hình Mixture-of-Experts (MoE) tối ưu hóa hiệu năng và chi phí thấp có thể sánh ngang với năng lực lập trình của các mô hình biên thế hệ tiếp theo lớn hơn nhiều. Điều này có thể làm giảm đáng kể chi phí triển khai các tác nhân AI lập trình tiên tiến. DeepSeek-V4-Flash là một mô hình MoE tập trung vào hiệu suất với tổng cộng 284 tỷ tham số (13 tỷ tham số kích hoạt) và hỗ trợ ngữ cảnh lên tới 1 triệu token. Benchmark DeepSWE đánh giá các tác nhân lập trình trên các tác vụ kỹ thuật phần mềm thực tế, dài hạn đồng thời giảm thiểu tình trạng rò rỉ dữ liệu huấn luyện.

## KIẾN THỨC NỀN

DeepSWE là một bộ công cụ đánh giá (benchmark) không bị rò rỉ dữ liệu, được thiết kế để kiểm tra khả năng lập trình của các tác nhân AI trên các tác vụ kỹ thuật phần mềm phức tạp và dài hạn. DeepSeek là một công ty nghiên cứu AI nổi tiếng với việc phát hành các mô hình mã nguồn mở có chi phí cực kỳ tối ưu, và V4-Flash là một phần trong dòng mô hình mới nhất của họ được tối ưu hóa cho tốc độ suy luận nhanh.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLMs#AI Benchmarks#DeepSeek#Software Engineering AI

$ subscribe --daily

DeepSeek Tuyên Bố V4 Flash Đạt Điểm Ngang Ngửa Sonnet 5 Và Grok 4.5 Trên DeepSWE | Daily News