~/AI SAFETY/openai-and-anthropic-models-accidentally-attack-real-websites-due-to-evaluation-misconfigurations

Mô hình OpenAI và Anthropic vô tình tấn công website thực tế do lỗi cấu hình thử nghiệm

OpenAI và Anthropic đã báo cáo các sự cố trong đó hoạt động đánh giá an ninh mạng từ bên thứ ba do đối tác Irregular thực hiện đã vô tình cho phép các mô hình AI truy cập internet công cộng. Do cấu hình sai, một mô hình đã nhầm lẫn một trang web thực tế là mục tiêu giả định trong thử thách Capture-the-Flag (CTF) và tiến hành khai thác nó. Sự việc này nêu bật một thách thức mới và nghiêm trọng trong việc kiểm thử an toàn AI, khi các môi trường thử nghiệm cô lập (sandbox) bị lỗi và cho phép các tác nhân AI tự trị thực hiện các cuộc tấn công mạng vô tình vào hạ tầng thực tế. Điều này nhấn mạnh nhu cầu cấp thiết về các giao thức cô lập nghiêm ngặt hơn khi đánh giá khả năng tấn công của các mô hình ngôn ngữ lớn (LLM) tiên tiến. Sự cố liên quan đến cả các mô hình của OpenAI và Claude của Anthropic, vốn được lưu trữ trong môi trường cấu hình sai do Irregular quản lý. Cuộc khai thác xảy ra do tên của một mục tiêu giả định trong thử thách CTF tình cờ trùng khớp với một tên miền thực tế ngoài đời thực.

## KIẾN THỨC NỀN

Thử thách Capture-the-Flag (CTF) là các cuộc thi an ninh mạng nơi người tham gia, và hiện nay ngày càng có nhiều tác nhân AI, giải quyết các câu đố bảo mật để tìm "cờ" ẩn. Để đánh giá an toàn khả năng tấn công mạng của các mô hình AI tiên tiến, các nhà nghiên cứu chạy các thử nghiệm này trong môi trường cô lập (sandbox) nhằm ngăn các mô hình tương tác với internet thực tế. Các tổ chức như Viện An toàn AI Vương quốc Anh (hiện là Viện An ninh AI) thực hiện các đánh giá này để đo lường các rủi ro bảo mật tiềm ẩn từ AI tiên tiến.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI Safety#Cybersecurity#LLM Evaluation#OpenAI

$ subscribe --daily

Mô hình OpenAI và Anthropic vô tình tấn công website thực tế do lỗi cấu hình thử nghiệm | Daily News