Google ra mắt mô hình AI Gemini 4 Argon giữa những hoài nghi từ nội bộ
Google đã bắt đầu triển khai hạn chế mô hình AI hàng đầu Gemini 4 Argon tới các đối tác an ninh mạng được lựa chọn, tuyên bố đạt điểm số hàng đầu trên nhiều bài kiểm tra benchmark. Tuy nhiên, các báo cáo từ Bloomberg cho biết nhiều nhân viên nội bộ Google đang hoài nghi về năng lực thực tế của mô hình này trong các tác vụ lập trình thực tiễn. Tranh cãi này làm nổi bật vấn đề 'benchmaxxing' ngày càng tăng trong ngành AI, nơi các mô hình đạt điểm số thử nghiệm cao nhưng không phản ánh đúng hiệu năng thực tế. Khi các đối thủ như OpenAI và Anthropic liên tục đẩy mạnh các mô hình và đại lý AI lập trình, Google cần Gemini 4 Argon mang lại hiệu quả thực sự để bảo vệ hệ sinh thái sản phẩm hàng tỷ người dùng của mình. Gemini 4 Argon được thiết kế cho các quy trình công việc kéo dài và phức tạp trong an ninh mạng, kỹ thuật phần mềm, tài chính và pháp lý, hỗ trợ đầu ra lên tới 1 triệu token (~750.000 từ) trong một lần phản hồi. Các nguồn tin nội bộ lưu ý rằng mô hình vượt trội về an ninh mạng và xử lý đầu vào phi văn bản như video, nhưng gặp khó khăn với thiết kế giao diện (frontend) và ngốn chi phí vận hành cao do quy mô rất lớn.
## KIẾN THỨC NỀN
Các bài kiểm tra benchmark AI là các công cụ chuẩn hóa được dùng để đánh giá mô hình ngôn ngữ lớn, nhưng các phòng thí nghiệm thường bị chỉ trích vì cố tình tối ưu hóa mô hình để vượt qua bài kiểm tra thay vì xây dựng các công cụ thực dụng. Google trước đó đã hủy bỏ dự án Gemini 3.5 Pro dự kiến sau khi bỏ lỡ thời hạn ra mắt, làm gia tăng áp lực nội bộ sau khi đã tiêu tốn hàng trăm triệu USD cho các lượt huấn luyện mô hình.