~/AI BENCHMARK/specific-labs-releases-real-swe-benchmark-for-evaluating-ai-on-private-codebases

Specific Labs Ra Mắt Real-SWE Benchmark Đánh Giá AI Trên Mã Nguồn Doanh Nghiệp Private

Specific Labs đã giới thiệu Real-SWE, một bộ benchmark mới được thiết kế để đánh giá các mô hình AI hàng đầu trong các tác vụ kỹ thuật phần mềm thực tế bằng cách sử dụng mã nguồn sản xuất riêng tư được cấp bản quyền từ các công ty thực tế. Phiên bản đầu tiên đánh giá các mô hình qua 10 tác vụ và 8 cấu hình khung thử nghiệm, bao gồm 640 lần chạy được chấm điểm. Các bộ benchmark lập trình hiện tại chủ yếu dựa vào các kho lưu trữ mã nguồn mở công khai, vốn có nguy cơ nhiễm dữ liệu và có thể không phản ánh chính xác quy trình phát triển phần mềm doanh nghiệp. Real-SWE cung cấp một tiêu chuẩn thực tế hơn để đánh giá mức độ hiệu quả của các AI agent khi giải quyết sự cố phần mềm trong môi trường doanh nghiệp độc quyền phức tạp. Bằng cách khai thác mã nguồn sản xuất có bản quyền thay vì các issue công khai trên GitHub, Real-SWE giảm thiểu nguy cơ các mô hình ghi nhớ giải pháp trong quá trình huấn luyện. Bộ benchmark đo lường hiệu suất mô hình qua nhiều lượt chạy thử nghiệm (rollout) để đánh giá cả năng lực lẫn độ tin cậy của giải pháp.

## KIẾN THỨC NỀN

Khả năng sinh mã của các mô hình ngôn ngữ lớn (LLM) từ trước đến nay thường được kiểm thử bằng các bộ benchmark như SWE-bench, nơi giao nhiệm vụ cho mô hình giải quyết các issue thực tế trên GitHub. Tuy nhiên, vì các kho lưu trữ công khai thường nằm trong tập dữ liệu huấn luyện của LLM, các nhà nghiên cứu cần những bộ benchmark riêng tư để kiểm thử chính xác khả năng tổng quát hóa của mô hình.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI Benchmarks#LLMs#Software Engineering#Code Generation

$ subscribe --daily

Specific Labs Ra Mắt Real-SWE Benchmark Đánh Giá AI Trên Mã Nguồn Doanh Nghiệp Private | Daily News