Thử nghiệm thực tế vạch trần mô hình MiMo-V2.6 bị thổi phồng điểm số và thất bại về bảo mật
Đánh giá thực tế từ một kỹ sư phần mềm cao cấp chỉ ra rằng các mô hình MiMo-V2.6 (bản Pro và Flash) gặp thất bại nghiêm trọng trước các tác vụ lập trình và bảo mật thực tế dù đạt điểm số rất cao. Mặc dù dẫn đầu trên bảng xếp hạng Artificial Analysis, MiMo-V2.6-Pro lại tạo ra mã nguồn chứa hàng loạt lỗ hổng bảo mật sơ đẳng, trong khi MiMo-V2.6-Flash rơi vào vòng lặp ảo giác tốn 80.000 token khi xử lý cây làm việc Git bị hỏng. Điều này phản ánh sự chênh lệch ngày càng lớn giữa các bài kiểm thử AI tiêu chuẩn và hiệu quả thực tế, đưa ra lời cảnh báo cho các nhà phát triển không nên chọn mô hình chỉ dựa vào bảng xếp hạng. Bài đánh giá cũng khuyên các kỹ sư không nên đầu tư phần cứng đắt tiền như AMD Gorgon Halo chỉ để chạy cục bộ các mô hình này. Trong bài kiểm tra tạo chính sách sandbox bằng Bubblewrap, MiMo-V2.6-Pro đã sinh ra đoạn mã dễ dàng bị qua mặt bởi các cờ lệnh đơn giản như `git push -uf`, alias, và biến môi trường—điều mà mô hình đối thủ GLM-5.3 sau đó đã phát hiện tới 9 lỗ hổng nghiêm trọng. Thêm vào đó, MiMo-V2.6-Flash không nhận biết được đường dẫn hỏng mà lại cố gắng thực hiện các thao tác nguy hiểm như can thiệp vào `/tmp` và `mount --bind`.
## KIẾN THỨC NỀN
Benchmaxxing là thuật ngữ chỉ việc nhà phát triển tối ưu hóa mô hình AI chủ yếu để đạt điểm cao trên các bài kiểm thử công khai nhưng thiếu khả năng tư duy thực tế. Bubblewrap là một công cụ sandbox trên Linux dùng để phân tách tiến trình an toàn, trong khi các phần cứng như AMD Gorgon Halo (Ryzen AI Max 400) cung cấp tới 192GB bộ nhớ dùng chung phù hợp để chạy các mô hình ngôn ngữ lớn cục bộ.