Thử nghiệm độc lập tái hiện điểm số 82,7% của DeepSeek V4 Flash trên Terminal-Bench 2.1
Một đánh giá độc lập sử dụng bộ công cụ Ante (phiên bản 0.preview.71) đã tái hiện thành công độ chính xác 82,7% của DeepSeek V4 Flash trên bài kiểm tra Terminal-Bench 2.1. Quá trình xác thực này được thực hiện với mô hình deepseek-v4-flash-0731 thông qua OpenRouter. Việc tái hiện độc lập các điểm số benchmark của LLM là rất quan trọng đối với tính minh bạch, đặc biệt là khi công bố ban đầu của DeepSeek dựa trên một bộ công cụ đánh giá nội bộ chưa được phát hành. Thử nghiệm thành công này giúp củng cố niềm tin vào khả năng của mô hình và chứng minh độ tin cậy của các công cụ đánh giá công khai như Ante và Harbor. Đánh giá bao gồm 445 lượt thử nghiệm trên 89 nhiệm vụ của Terminal-Bench, đạt được 368 lượt thành công với sai số chuẩn là ±1,79%. Thử nghiệm được cấu hình với nỗ lực suy luận tối đa và không kích hoạt kỹ năng bổ sung nào, cho thấy mô hình này khá nhạy cảm với cách thiết lập bộ công cụ đánh giá.
## KIẾN THỨC NỀN
Terminal-Bench là một bộ tiêu chuẩn đánh giá được thiết kế để đo lường mức độ hiệu quả của các tác nhân AI khi điều hướng và giải quyết tác vụ trong giao diện dòng lệnh (CLI). Harbor là một khung phát triển mã nguồn mở được sử dụng để đánh giá và tối ưu hóa các tác nhân này. Các bộ công cụ đánh giá như Ante cung cấp môi trường chuẩn hóa để chạy các bài kiểm tra này, đảm bảo kết quả benchmark có thể được xác minh và so sánh một cách công bằng giữa các mô hình khác nhau.