~/LLMS/deepseek-v4-flash-0731-low-reasoning-effort-mode-unexpectedly-uses-more-tokens

Chế độ suy luận 'Low' của DeepSeek-V4-Flash-0731 bất ngờ dùng nhiều token hơn 'High'

Các thử nghiệm thực tế đối với mô hình DeepSeek-V4-Flash-0731 cho thấy chế độ suy luận "Low" bất ngờ tạo ra nhiều token suy luận và token kết quả hơn so với chế độ "High". Hành vi ngược đời này được ghi nhận ở cả thử nghiệm cục bộ sử dụng phiên bản lượng tử hóa UD-Q2_K_XL của Unsloth lẫn thông qua API chính thức của DeepSeek. Phát hiện này rất quan trọng đối với các nhà phát triển đang muốn tối ưu hóa chi phí API và độ trễ, vì việc chọn chế độ "Low" có thể vô tình làm tăng lượng token tiêu thụ và chi phí so với chế độ "High". Nó cũng chỉ ra những điểm bất nhất tiềm ẩn trong cách mô hình thực thi hoặc diễn giải các tham số về mức độ suy luận. Trong các thử nghiệm API, chế độ "Low" tiêu thụ trung bình 1.349,2 tổng số token (889,6 token suy luận) so với chỉ 481,5 tổng số token (253,9 token suy luận) ở chế độ "High". Ngoài ra, người thử nghiệm cũng lưu ý một lỗi nghiêm trọng trên OpenRouter hiện đang làm hỏng các chế độ tùy chỉnh mức độ suy luận của mô hình này.

## KIẾN THỨC NỀN

Các mô hình suy luận (LRM) được huấn luyện để thực hiện các bước tư duy logic đa bước trước khi đưa ra câu trả lời cuối cùng. Các API LLM hiện đại cho phép người dùng điều chỉnh tham số "mức độ suy luận" (reasoning effort) để kiểm soát lượng tài nguyên tính toán hoặc "thời gian suy nghĩ" mà mô hình nên dành cho một tác vụ. Định dạng Dynamic v2.0 GGUF của Unsloth (như UD-Q2_K_XL) là một phương pháp lượng tử hóa tiên tiến giúp chạy các LLM cục bộ với độ chính xác cao và giảm dung lượng bộ nhớ.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLMs#DeepSeek#AI Benchmarking#API Optimization

$ subscribe --daily

Chế độ suy luận 'Low' của DeepSeek-V4-Flash-0731 bất ngờ dùng nhiều token hơn 'High' | Daily News