Việc Đánh Giá Lại Benchmark LLM Cục Bộ Làm Nổi Bật Bẫy Quy Trình và Khả Năng Mở Rộng Nỗ Lực Suy Luận
Một nhà nghiên cứu độc lập trong cộng đồng đã chạy lại thử nghiệm benchmark Django SWE-verified kéo dài nhiều tuần trên các LLM cục bộ sau khi phát hiện sự thiếu ổn định trong quy trình đánh giá. Kết quả đánh giá đã sửa đổi cho thấy mức tăng hiệu suất rõ ràng hơn khi tăng nỗ lực suy luận của mô hình từ mức trung bình lên mức cực cao (xhigh), đặc biệt là với các mô hình hàng đầu như Flash Next. Bài viết này nhấn mạnh tầm quan trọng cốt lõi của việc đảm bảo môi trường đánh giá ổn định và có thể tái lập khi kiểm thử các mô hình AI trong thời gian dài. Nó cũng cung cấp thông tin thực nghiệm quý giá cho các nhà phát triển, cho thấy thiết lập nỗ lực suy luận cao hơn có thể mang lại cải thiện hiệu suất thực tế trong các tác vụ kỹ thuật phần mềm phức tạp. Bộ đánh giá sử dụng tập hợp 100 tác vụ Django dựa trên SWE-bench verified để kiểm tra khả năng tạo mã và ảnh hưởng của lượng tử hóa trên các LLM mã nguồn mở. Sau khi sửa các lỗi quy trình, tác giả lưu ý rằng mặc dù nỗ lực suy luận cực cao (xhigh) giúp tăng điểm benchmark, mức nỗ lực trung bình vẫn thực tế và phù hợp hơn cho công việc lập trình hàng ngày do hạn chế về tốc độ và hiệu quả.
## KIẾN THỨC NỀN
SWE-bench Verified là một tiêu chuẩn đánh giá phổ biến kiểm tra khả năng của các LLM trong việc giải quyết các vấn đề kỹ thuật phần mềm thực tế từ các kho lưu trữ GitHub. Lượng tử hóa (Quantization) là kỹ thuật nén giúp giảm độ chính xác tham số của mô hình để chạy các mô hình lớn trên GPU người dùng cuối với VRAM hạn chế. Nỗ lực suy luận (Reasoning effort) chỉ các cài đặt trong các mô hình suy luận cho phép điều khiển số bước tính toán hoặc số lượng token mô hình dùng để suy nghĩ trước khi đưa ra câu trả lời.