OpenAI và Anthropic từng thảo luận thỏa thuận pháp lý để kiểm thử an toàn AI lẫn nhau
Theo báo cáo, OpenAI và Anthropic đã đàm phán một thỏa thuận có tính ràng buộc pháp lý vào đầu năm nay nhằm kiểm thử sức chịu đựng và tìm lỗ hổng bảo mật trên các mô hình AI thương mại của nhau trước khi ra mắt. Cuộc đàm phán có sự tham gia của đội ngũ luật sư hai bên để thiết lập cơ chế "red teaming" (kiểm thử đối kháng) thông qua quyền truy cập API. Hợp tác tiềm năng này cho thấy sự chuyển dịch hướng tới các cơ chế kiểm thử an toàn dạng đồng nghiệp giữa các phòng thí nghiệm AI đối thủ nhằm giảm thiểu rủi ro an ninh mạng trước khi triển khai. Điều này phản ánh xu hướng ngày càng tăng trong ngành nhằm chuẩn hóa việc đánh giá an toàn AI, dù qua kiểm thử chéo giữa các đối thủ hay thông qua các tổ chức kiểm toán độc lập. Theo thỏa thuận đề xuất, hai công ty sẽ trao đổi quyền truy cập API đối với các mô hình thương mại công khai thay vì các phiên bản nội bộ chưa ra mắt, kèm theo cam kết không lưu trữ dữ liệu của nhau. Trong khi đó, CEO Sam Altman của OpenAI và CEO Dario Amodei của Anthropic cũng bày tỏ sự ủng hộ đối với các khuôn khổ an toàn khác, chẳng hạn như cấp cho các đơn vị kiểm toán độc lập quyền truy cập sâu vào mô hình và quy trình kiểm tra nội bộ.
## KIẾN THỨC NỀN
"Red teaming" trong lĩnh vực AI là phương pháp kiểm thử đối kháng, trong đó các nhà nghiên cứu mô phỏng các cuộc tấn công độc hại—như bẻ khóa (jailbreak), chèn câu lệnh (prompt injection) hoặc khai thác an ninh mạng—để tìm ra lỗ hổng của mô hình trước khi phát hành. Khi các mô hình AI ngày càng mạnh mẽ, các nhà phát triển hàng đầu chịu áp lực ngày càng lớn từ cơ quan quản lý và công chúng trong việc thực hiện các quy trình kiểm tra an toàn nghiêm ngặt và công khai các sự cố bảo mật.