Đánh Giá Mô Hình LLM Cục Bộ Và API Trên Bài Thử Nghiệm An Ninh Mạng
Một nhà phát triển độc lập đã xây dựng Rangebench, bộ kiểm thử Capture The Flag (CTF) gồm 19 nhiệm vụ nhằm đánh giá khả năng tấn công mạng tự động của LLM trong môi trường Docker cô lập. Kết quả thử nghiệm cho thấy mô hình mã nguồn mở cục bộ Qwen3.8 27B đạt tỷ lệ thành công 28,1% ngay lần thử đầu tiên, trong khi các mô hình API thương mại như GPT-6 Luna đạt tỷ lệ giải quyết bài toán lên tới 90,9%. Trong bối cảnh lo ngại gia tăng về việc kẻ tấn công mạng sử dụng AI cục bộ cho các hoạt động bất hợp pháp, bộ kiểm thử này chứng minh rằng các mô hình mã nguồn mở quy mô vừa hiện chưa tạo ra đe dọa lớn ở những nhiệm vụ khai thác phức tạp như pwn so với các mô hình API hàng đầu. Dự án cung cấp cho cộng đồng AI mã nguồn mở một khuôn khổ thực tế để đánh giá năng lực của agent AI trong môi trường tương tác thực sự. Đợt đánh giá vận hành các mô hình cục bộ thông qua cơ chế suy luận phân tán llama.cpp RPC trên hai nút Proxmox trang bị GPU RTX 3090 và 3080 kết nối qua mạng 2.5Gbps. Qua 544 lượt thử được chấm điểm, hạng mục khai thác lỗ hổng bộ nhớ và nhị phân (pwn) vẫn là thử thách khó nhất đối với mọi mô hình, với điểm số cao nhất đạt được chỉ là 56%.
## KIẾN THỨC NỀN
Các bộ kiểm thử Capture The Flag (CTF) đánh giá agent AI bằng cách yêu cầu chúng tương tác với giao diện dòng lệnh trong môi trường phần mềm cô lập để tìm các chuỗi bí mật (flag) thuộc các lĩnh vực như bảo mật web, mật mã học và kỹ thuật đảo ngược. Việc phân tán suy luận LLM qua các giao thức như llama.cpp RPC cho phép chia nhỏ tính toán ma trận trên nhiều nút GPU hoặc CPU từ xa, giúp việc chạy các mô hình lớn trên phần cấp tiêu dùng trở nên khả thi.