Công bố các chỉ số hiệu suất của mô hình DeepSeek-V4-Flash-20260731(High)
LMSYS Chatbot Arena đã chia sẻ các chỉ số hiệu suất ban đầu của biến thể mô hình DeepSeek-V4-Flash-20260731(High) trên năm tín hiệu đánh giá chính. Mô hình này cho thấy những cải thiện về tỷ lệ thành công chung, khả năng khôi phục lỗi Bash và giảm ảo giác công cụ, nhưng lại giảm nhẹ về khả năng định hướng (steerability). Các chỉ số này cung cấp cái nhìn sớm về khả năng của biến thể mô hình flash mới từ DeepSeek, giúp các nhà phát triển hiểu rõ điểm mạnh và điểm yếu của nó trong các tác vụ thực tế như lập trình và sử dụng công cụ. Điều này làm nổi bật sự đánh đổi liên tục trong việc tối ưu hóa LLM, nơi mà việc cải thiện tỷ lệ thành công của tác vụ đôi khi phải trả giá bằng khả năng định hướng. Mô hình đạt mức tăng +6,99% về tỷ lệ thành công được xác nhận và cải thiện +1,98% về tổng thể, cùng với tỷ lệ ảo giác công cụ là 1,2% và khôi phục lỗi Bash là 2,53%. Tuy nhiên, điểm số về khả năng định hướng (steerability) của nó đã giảm 2,31%, cho thấy mô hình có thể khó định hướng hơn một chút theo các mục tiêu hoặc tính cách người dùng cụ thể.
## KIẾN THỨC NỀN
Trong bối cảnh của các mô hình ngôn ngữ lớn, khả năng định hướng (steerability) đề cập đến khả năng hướng dẫn đầu ra của mô hình để phù hợp với các mục tiêu, quan điểm hoặc tính cách cụ thể của người dùng. Ảo giác công cụ (tool hallucination) xảy ra khi LLM tạo ra hoặc gọi các công cụ hoặc API bên ngoài không tồn tại hoặc không phù hợp với ngữ cảnh một cách sai lệch. Khả năng khôi phục lỗi Bash (bash recovery) đánh giá khả năng xử lý và khắc phục các lỗi dòng lệnh của mô hình khi thực thi các tập lệnh Bash.