Sự hoài nghi xoay quanh tuyên bố hiệu năng của mô hình BigBang-v1 từ endless-frontier
Mô hình "endless-frontier/BigBang-v1", một bản tinh chỉnh (fine-tune) từ Qwen3.6-35B-A3B, đã được phát hành với tuyên bố đạt hiệu năng tổng hợp tương đương các mô hình lớn hơn nhiều như DeepSeek V4 Flash và Pro. Tuy nhiên, các phân tích độc lập về điểm số benchmark của mô hình này đã dấy lên nhiều sự hoài nghi. Điều này làm nổi bật thách thức đang diễn ra trong cộng đồng LLM liên quan đến việc rò rỉ dữ liệu đánh giá (benchmark contamination) và độ tin cậy của điểm số tổng hợp, đặc biệt khi các mô hình nhỏ hơn tuyên bố vượt trội hơn các mô hình hỗn hợp chuyên gia (MoE) khổng lồ. Nó nhấn mạnh nhu cầu về các phương pháp đánh giá minh bạch trong phát triển AI mã nguồn mở. Mặc dù những người tạo ra mô hình tuyên bố hiệu năng tổng hợp cao, điểm số của từng benchmark riêng lẻ lại dao động rất lớn, từ mức khá là 50 trên Humanity's Last Exam (HLE) cho đến mức thấp 15,7 trên BioMystery-HD. Các nhà phê bình nghi ngờ có sự rò rỉ dữ liệu đánh giá vì quy trình huấn luyện sử dụng các tác nhân phản biện (critic agents) được hiệu chỉnh trên các nhiệm vụ nghiên cứu có thể trùng lặp với tập dữ liệu đánh giá.
## KIẾN THỨC NỀN
BigBang-v1 được phát triển bằng cách sử dụng khung dữ liệu tổng hợp tự tiến hóa, đối nghịch, nơi các tác nhân tạo (generator) và phản biện (critic) liên tục tinh chỉnh dữ liệu huấn luyện. Việc đánh giá các LLM thường phụ thuộc vào các bài kiểm tra tiêu chuẩn như Humanity's Last Exam (HLE), nhưng các mô hình có thể làm tăng điểm số một cách nhân tạo nếu các câu hỏi kiểm tra hoặc các mẫu tương tự vô tình bị đưa vào dữ liệu huấn luyện của chúng, một hiện tượng được gọi là rò rỉ dữ liệu đánh giá (benchmark contamination).