~/OPENAI/openai-repeatedly-modifies-gpt-6-astra-benchmark-data-following-launch-post

OpenAI Liên Tục Sửa Đổi Dữ Liệu Benchmark Của GPT-6 Astra Sau Khi Đăng Tải

OpenAI đã liên tục chỉnh sửa các con số đánh giá benchmark trong bài đăng công bố GPT-6 Astra ngay sau khi xuất bản vào ngày 3 tháng 9. Các điều chỉnh sau khi phát hành này làm thay đổi tỷ lệ tạo ảo giác (hallucination) của Astra, điểm số lập trình, và thậm chí cả kết quả benchmark của các mô hình đối thủ như Anthropic Fable 5.1. Việc thay đổi điểm số liên tục này làm nổi bật những lo ngại về độ tin cậy, tính minh bạch và sự nhất quán của các bài kiểm tra benchmark LLM trong ngành AI. Điều này phản ánh thực trạng các nhà phát triển có thể thực hiện 'benchmaxxing' bằng cách thay đổi thiết lập thử nghiệm, công cụ hỗ trợ hoặc checkpoint nhằm quảng bá những con số ấn tượng nhất. Tỷ lệ tạo ảo giác của Astra ban đầu giảm từ 4,2% xuống 2% trước khi khôi phục lại 4,2%, trong khi điểm ARC-AGI-3 đạt 99,99% khi được trang bị khung công cụ mở rộng so với 63% trong điều kiện tiêu chuẩn. OpenAI thừa nhận rằng các điểm số được công bố đại diện cho hiệu suất tối đa đạt được trong điều kiện tài nguyên tối ưu chứ không phải trải nghiệm người dùng thông thường.

## KIẾN THỨC NỀN

Các bài kiểm tra benchmark đánh giá mô hình ngôn ngữ lớn (LLM) là bộ công cụ tiêu chuẩn được các nhà nghiên cứu và phát triển sử dụng để so sánh năng lực AI trên các tác vụ như lập luận, toán học và lập trình. Tuy nhiên, kết quả benchmark có thể biến động đáng kể tùy thuộc vào cách thiết kế prompt, công cụ hỗ trợ hệ thống, tham số suy luận và môi trường thử nghiệm. Bên cạnh đó, các vấn đề như nhiễm bẩn dữ liệu (data contamination)—khi dữ liệu kiểm tra bị lẫn vào tập dữ liệu huấn luyện—và việc tối ưu hóa tham số để tăng thứ hạng làm cho việc đánh giá công bằng trở nên phức tạp.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#OpenAI#AI Benchmarks#LLM Evaluation#AI News

$ subscribe --daily