~/LLMS/prompt-template-benchmark-for-qwen3-8-flash-next-on-swe-bench-verified

Đánh giá hiệu năng các mẫu prompt cho Qwen3.8 Flash Next trên SWE-bench Verified

Một thử nghiệm thực nghiệm đã đánh giá ba mẫu prompt (Stock, Fixed và Sharp) ở các mức độ suy luận trung bình (medium) và cực cao (xhigh) cho Qwen3.8 Flash Next trên 100 nhiệm vụ SWE-bench Verified. Kết quả cho thấy mẫu Sharp dẫn đầu về tỷ lệ giải quyết (94%) ở mức suy luận trung bình, nhưng mẫu Stock mặc định lại đạt tỷ lệ giải quyết cao nhất (99%) khi nâng lên mức suy luận cực cao. So sánh này cho thấy các mẫu prompt chuyên biệt như Sharp mang lại tốc độ và độ chính xác tối ưu ở ngân sách suy luận thấp hơn, nhưng các mẫu cơ bản lại hoạt động tốt hơn khi được cấp nhiều token suy luận hơn. Điều này cung cấp hướng dẫn thực tế cho các nhà phát triển LLM cục bộ trong việc cân bằng giữa độ trễ thực thi và độ chính xác công việc. Thử nghiệm đã đánh giá mô hình lượng tử hóa Qwen3.8-Flash-Next-NVFP4 của RadixArk sử dụng mini-SWE-agent 2.4.6 trên GPU RTX PRO 6000 WS với ngữ cảnh 262K. Việc tăng mức suy luận từ trung bình lên cực cao không cải thiện độ chính xác cho mẫu Sharp (giữ nguyên 94%) dù thời gian chạy tăng 53,4%, trong khi mẫu Stock tăng từ 91% lên 99%.

## KIẾN THỨC NỀN

SWE-bench là bộ kiểm thử tự động đánh giá khả năng của LLM trong việc giải quyết các sự cố mã nguồn thực tế trên GitHub. mini-SWE-agent là một khung mã nguồn mở gọn nhẹ được thiết kế để tự động hóa quy trình làm việc của agent kỹ thuật phần mềm một cách hiệu quả. NVFP4 là định dạng lượng tử hóa số thực dấu phẩy động 4-bit của NVIDIA giúp tối ưu hóa suy luận mô hình với hiệu năng cao mà không làm sụt giảm đáng kể độ chính xác.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLMs#Prompt Engineering#SWE-bench#Model Benchmarking#Local AI

$ subscribe --daily

Đánh giá hiệu năng các mẫu prompt cho Qwen3.8 Flash Next trên SWE-bench Verified | Daily News