Các hãng AI có đang tối ưu hóa quá mức cho benchmark "bồ nông đi xe đạp"?
Dylan Castillo đã thực hiện một đánh giá có cấu trúc đối với bảy mô hình AI lớn trên 48 tổ hợp câu lệnh động vật - phương tiện để xem liệu các phòng nghiên cứu có đang tối ưu hóa quá mức cho benchmark phổ biến "bồ nông đi xe đạp" hay không. Nghiên cứu không tìm thấy bằng chứng đáng kể nào cho thấy hiện tượng "pelicanmaxxing", vì các mô hình không vẽ tổ hợp cụ thể này tốt hơn các động vật hoặc phương tiện khác. Phân tích này giải quyết các lo ngại về việc gian lận và làm nhiễm độc benchmark, nơi các nhà phát triển AI có thể huấn luyện mô hình trên các câu lệnh thử nghiệm lan truyền để tăng hiệu suất ảo một cách nhân tạo. Kết quả này trấn an cộng đồng rằng các benchmark không chính thức vẫn có thể đóng vai trò là các chỉ số tương đối khách quan cho khả năng chung của mô hình. Đánh giá đã thử nghiệm các mô hình như GPT-5.6 Terra, Claude Sonnet 5 và Gemini 3.5 Flash bằng cách sử dụng 8 loài động vật và 6 phương tiện, với sự hỗ trợ chấm điểm từ GPT-5.6 Luna và Gemini 3.1 Flash-Lite. Mặc dù GLM-5.2 cho thấy hiệu suất tăng nhẹ đối với câu lệnh bồ nông đi xe đạp, nhưng mức độ ảnh hưởng là quá nhỏ để có ý nghĩa thống kê.
## KIẾN THỨC NỀN
Câu lệnh "Tạo một file SVG vẽ con bồ nông đi xe đạp" được phổ biến bởi nhà phát triển Simon Willison như một benchmark không chính thức để kiểm tra khả năng suy luận không gian và tạo mã nguồn của các mô hình AI. Trong học máy, hiện tượng "nhiễm độc benchmark" hoặc "gian lận benchmark" xảy ra khi các mô hình được huấn luyện trực tiếp trên tập dữ liệu kiểm tra, dẫn đến điểm số cao nhưng không phản ánh đúng năng lực thực tế.