OpenAI và Anthropic chính thức thuê các bên kiểm toán an toàn AI độc lập
Các phòng thí nghiệm nghiên cứu AI hàng đầu là OpenAI và Anthropic đã chính thức hợp tác với các đơn vị kiểm toán độc lập bên thứ ba để đánh giá độ an toàn cho các mô hình AI của họ. Sáng kiến này chuyển dịch việc xác minh độ an toàn từ tự đánh giá nội bộ sang kiểm toán khách quan từ bên ngoài. Việc kiểm toán an toàn độc lập giải quyết lo ngại ngày càng tăng từ công chúng và các cơ quan quản lý về sự tự điều chỉnh trong phát triển AI tiên phong. Bằng cách mời các bên kiểm toán độc lập, các công ty AI có thể tăng cường tính minh bạch, giảm thiểu xung đột lợi ích và giúp ngăn ngừa rủi ro như lệch lạc mục tiêu hoặc bị lạm dụng trước khi phát hành mô hình. Các bên kiểm toán an toàn bên ngoài thường thực hiện những đánh giá nghiêm ngặt như kiểm thử xâm nhập (red-teaming), kiểm tra sự đồng điệu mục tiêu và kiểm tra mức độ tuân thủ tiêu chuẩn quản lý. Tuy nhiên, hiệu quả thực sự của các cuộc kiểm toán này phụ thuộc lớn vào việc liệu người kiểm toán có nhận được đủ quyền truy cập vào trọng số mô hình, câu lệnh hệ thống và dữ liệu huấn luyện hay không.
## KIẾN THỨC NỀN
Các đơn vị phát triển AI hàng đầu đang tạo ra các mô hình ngôn ngữ lớn ngày càng phức tạp, kéo theo những rủi ro an toàn mới nổi như hỗ trợ tấn công mạng, hành vi lừa dối và tạo nội dung độc hại. Trước đây, các phòng thí nghiệm AI đánh giá độ an toàn chủ yếu thông qua đội ngũ nội bộ hoặc các đối tác tự nguyện, điều mà các nhà phê bình cho rằng thiếu tính trách nhiệm ràng buộc và sự giám sát độc lập từ bên ngoài.